@Axon用 SGLang 本地部署 DeepSeek-V4-Flash记录 中发帖

环境与版本
- 服务器:Ubuntu 22.04 
- 显卡驱动:CUDA 13.3 
- 依赖管理:uv 
- 下载工具:`modelscope==1.39.1` 
- 推理引擎:`lmsysorg/sglang:latest-cu130` 
- 模型:`deepseek-ai/DeepSeek-V4-Flash-0731`(48 个分片,约 156GB,混合精度) 
- 部署规模:4 张 H800(TP4)即可完整跑 
1. 下载模型
使用 ModelScope 将模型下载到本地。大文件下载建议绕过本地代理,避免代理限制大文件并发导致极慢: 
```bash 
env -u HTTP_PROXY -u HTTPS_PROXY -u http_proxy -u https_proxy \ 
-u ALL_PROXY -u all_proxy \\

uv run --python 3.1...
 
 
Back to Top