落寞书生 (@luomoshusheng)qwen3.8 flash 本地部署飞起 中发帖

llama.cpp 折腾日记
之前主力用的是 Qwen3.8-Flash-Next(从 Qwen3.8 27B 切过来的),部署方案是经典的 llama.cpp + Unsloth UD-Q4_XL 量化。 
说实话,短上下文(比如几千字对话)体验确实不错,速度能稳在 40 t/s,质量也没啥问题。但一旦遇到长文档场景(比如 100k 上下文),直接崩盘: 

Decode 速度腰斩:从 40 t/s 掉到 20 t/s,生成速度肉眼可见地变慢,基本没法用。
Prefill 太慢:刚开始读文档那会儿(Prefill阶段),峰值也就 500 t/s 左右,随着上下文累积,速度还会进一步掉到 300+ t/s。处理一个长 PDF 得干等着,体验极差。

💡 换引擎vllm
最近看到社区有个针对长上下文优化的版本:huggingface上面的 albucino/Qwen3.8-Flash-Nex...
 
 
Back to Top