害你的猪 (@zhousp666)贴一下我的unsloth/Qwen3.8-27B-UD-Q6_K_M.gguf使用结果 中发帖

显卡是5880ada,目前只用了单卡,上下文开到了512K,速度是50t/s~60t/s 
当作工具使用让我很满意 
运行的命令 
CUDA_VISIBLE_DEVICES=5 /data_nvme_extra/llama.cpp/build/bin/llama-server \
  --alias "Qwen3.8-27B" \
  -m /data_nvme_extra/huggingface_models/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q6_K_M.gguf \
  --mmproj /data_nvme_extra/huggingface_models/Qwen3.8-27B-GGUF/mmproj-BF16.gguf \
  -ngl 99 \
  -c 524288 \
  --rope-scaling yarn \
  --rope-scal...
 
 
Back to Top