未完待续 (@nht163017)买了台无头骑士部署本地模型玩玩 中发帖

32G内存m1pro想部署Qwen3.8 27B 的q4版本,大概16G的那个,怎么才能开到长上下文(想用128k),lm和ollama都不太行(lm强制限制40多k上下文改不了,然后ollama后面跑到快100k的时候回复一下要思考一个小时),然后问ai,ai说用omlx,但是缓存率只有个位数,
 
 
Back to Top