飛空 (@feikong)单卡4090,本地跑Qwen3.8-27B,效果还是挺惊艳的 中发帖

启动配置
Q2量化版本,开启视觉,128k上下文,60-80 token/s 
思考时间比较长 😂 鹈鹕骑自行车思考了9分钟 
/home/ubuntu/ai/llama.cpp/build/bin/llama-server \
  -m /home/ubuntu/ai/model/Qwen3.8-27B-UD-Q2_K_XL.gguf \
  --mmproj /home/ubuntu/ai/model/mmproj-BF16.gguf \
  --ctx-size 131072 \
  --flash-attn on \
  --spec-type draft-mtp \
  --spec-draft-n-max 2 \
  --spec-draft-p-min 0.75 \
  -ngl 99 \
  --temp 0.75 \
  --top-p 0.95 \
  --top-k ...
 
 
Back to Top