DT (@DT2025)DGX Spark 单机部署 Qwen3.8-27B:NVFP4 量化 + DSpark 投机解码实践 中发帖

最近手里搞到一台DGX Spark,上周看见Qwen3.8-27B出来了就顺手部署了一个,一开始直接用vllm跑了一下,感觉性能太差,decode只有个位数,就用ds调了几天,现在感觉差不多了,拿出来给大家分享下配置,有更好方案的佬友也可以给点建议 
1. 核心配置

镜像: lmsysorg/sglang:qwen38-27b
主模型: Qwen3.8-27B-NVFP4
draft 模型: RadixArk/Qwen3.8-27B-DSpark
投机算法: DSPARK,block size 7
KV cache: fp8_e4m3 · dtype: bfloat16 · 上下文: 262,144
注意力: flashinfer · prefill: chunked 8192
内存: mem-fraction 0.88

2. 测试结果
周末部署完成后又去找了几个官方测试用例,跑了一晚...
 
 
Back to Top