无奇 (@imeradel)没有nvlink的显卡性能部署大模型差别能有多大 中发帖

小弟新入职一家中小型公司,最近公司想搞一台13-15W左右的服务器跑qwen3.8 27b模型.负责人之前没搞过本地部署,我之前的公司搞过很多本地部署的工作,我也有所了解,但是基本都不是用的cuda 
我寻思能整两张4090或者一张a6000用vllm跑fp8或者Q4 Q5量化 
4090没有nvlink,不知道瓶颈会不会在pcie4.0上 
不然就一张5090跑个Q4量化,那emmbeding就得扔cpu去跑了 
佬友们给点建议,没有nvlink,使用tp模式两张卡之间通信会影响很大么 
还有个同事给了个建议用华为Atlas卡有48g跑vllm-ascend跑模型,但是从我以前的经验来看,怀疑性能会比cuda同性能的卡差不少
 
 
Back to Top