@Love_Runs_Out求大佬们教一下本地部署优化 中发帖

小白自己搭着玩的 
推理速度稳定在 ~28.45 tokens/s, 
设备:双路 NVIDIA RTX 5880 Ada Generation 单卡 48GB显存,拿pcie连一起的 
模型:Qwen/Qwen3.8-27B (270亿参数,原生 BF16 精度完整加载,权重占用约 51GB) 
直接从hf拉下来的官方原生,有没有什么好建议,感觉输出的好慢,想要快一点 
是换轻量化一点的模型,还是有什么加速推理的技巧,能否请大佬指点一二,可以直接甩我链接我自己学,不胜感激
 
 
Back to Top