凌风神舞 (@kant)小米/xiaomi AI Cube 推理性能估算 中发帖

[image] 
 [image] 
 [image] 
今天小米发了三颗芯片, 把这三颗芯片塞到一个机子的AI Cube, 就非常感兴趣. 
我根据今天放出的消息, 尝试推算了如果拿这台AIPC去推 Qwen 3.8 27B会是什么表现. 
我们假设这台机子, 塞了一块128g的统一内存, 然后96g可以用于动态分配. 
已知: 

带宽是1.22TB/s, 终于来了一个肯给带宽的机子了, dgx spark的273GB/s是什么渣渣.
端侧推理速度是330 Tokens/s, 结合第二张图, 可知, 这个速度是在3B模型下跑出来的, 这个模型是一个5值模型, 这个算下来, 只吃了30%~40%的带宽, 感觉是为了给多模态, 语音, 上下文, 留足了带宽空间.

我们采用Qwen 3.8 27B Q8_0版本, 模型文件大小是28.6GB, 为了方便计算, 我们直接按照30GB算 
上...
 
 
Back to Top