Ruby (@Ruby_axx)记录一个qwen3.8 27b自部署接入dsh出现压缩失败的bug和解决方案 中发帖

起因是把qwen3.8 27b接入dsh里使用的时候有时候会遇到compact压缩失败的问题。 
[image] 
一开始以为是模型指令遵循失败导致的,但是后续一压缩失败就继续会话,这个表现不像是指令遵循失败的现象。 
于是我另开了一个会话排查了一下原因,发现是: 

原有的压缩策略会显式的控制压缩上下文上限为8192token。若直接将模型指定为qwen3.8 27b其雷霆大思考本身会导致上下文超过8192的与之被截断,就出现了压缩失败的问题。 

想要解决这个问题也很简单。额外指定一个compact的provider(本地),将思考关闭即可。 
以下是.dsh/settings.yaml 
    llama-compact:
      displayName: llama.cpp (compaction) #显示名称
      apiKeyEnv: LLAMA_API_KEY #...
 
 
Back to Top