@KemouArxiv 论文:4060 笔电也能跑几十 B 模型了,吼吼吼夸张哦 中发帖

一句话总结: 

原本个人PC跑不起来大模型,主要是因为显存不够用,但是如果把东西放到CPU内存后,PCIe传输速度成了瓶颈 
这个优化直接把整个电脑视作一个整体,灵活地把 MoE 里不常用的 Expert 放到 CPU 内存里,常用的放在 GPU,甚至让一部分直接用 CPU 算,从而实现个人电脑跑大 MoE 

具体实例: 

4060 笔电 32g 内存跑Qwen3.6-35B-A3B,30+tok/s 


5090 192ram 跑 dsv4f(284b a13B),20tok/s 


 [image]测试的设备跑 Qwen3.6,注意到速度没差多少,因为算力不是核心瓶颈 

原论文: [2608.16157] FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution 
要注意的是...
 
 
Back to Top