找找 (@puphou) 在 Qwen3.8-27b和GPT5.6 Luna Max谁强呢 中发帖
闲着用电脑上的4090和llama.cpp搭了个本地的API,模型是unsloth的Qwen3.8-27B-UD-Q4_K_XL,24G显存用Q8 kv cache后也只能128K的上下文。
然后今天用本地部署的Qwen3.8-27b完整做一个洗稿的项目,项目规划先用codex做好了,然后丢给DeepSeek Harness调用本地API执行,结果断断续续差不多跑了5个多小时,平均63 t/s的速度,感觉用这东西日常干活还是慢啊。
准备明天给luna max相同的规划方案再跑一次,两边对比下,这种简单的洗稿项目,plus订阅的luna max应该半天也能跑完了。
[image]