@seq001 在 5090 GPU+cpu 混合推理 Qwen3.8-Flash-Next-UD-Q4_K_XL,测试鹈鹕骑自行车 中发帖
部署:llama.cpp
用了一个5090,内存占用74G,CPU占用1200%,
./build/bin/llama-server -m /modelscope/Qwen3.8-Flash-Next-GGUF/UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf --alias Qwen3.8-Flash-Next -ngl 99 --device CUDA1 --cpu-moe --expert-hot-s 140 -c 81920 -fa on --jinja --port 8091 --host 0.0.0.0
测试
8.13 tokens每秒,跑了1个半小时。
eval time = 5475543.96 ms / 44533 tokens ( 122.96 ms per token, 8.1...