炫彩小鱼干 (@Yuookie)经过两天的尝试,4090 显卡 Qwen3.8-27B 全上下文,开视觉 115 token/s,配置分享 中发帖

终于把这个模型调到了满意程度:262k 上下文,开启视觉,短、中上下文文本输出约 115 tps 
相较于 ds v4 flash 的 140 tps,这个稍慢但是有视觉,上下文短,但部署在自己的硬件上,完全免费 
我的显卡是 4090D ,24GB显存,以下是配置分享: 
模型:Qwen3.8-27B-NVFP4
框架:llama.cpp
KV Cache:Q4_0
视觉:开启,F16 mmproj
推测解码:MTP n=2 + ngram-mod
Batch:1024
Ubatch:512

更多极限测试: 
254K 预填充:623.7 tps
254K 上下文时输出:30.8 tps
视觉输出:68 tps

默认思考时间确实长,但是关思考又太笨,可能是小模型的无奈之举吧,但在这个速度下,确实是相当可用的智能 
有显卡的可以试试了,免费 tokens 确实爽啊
 
 
Back to Top