@Axon 在 用 SGLang 本地部署 DeepSeek-V4-Flash记录 中发帖
环境与版本
- 服务器:Ubuntu 22.04
- 显卡驱动:CUDA 13.3
- 依赖管理:uv
- 下载工具:`modelscope==1.39.1`
- 推理引擎:`lmsysorg/sglang:latest-cu130`
- 模型:`deepseek-ai/DeepSeek-V4-Flash-0731`(48 个分片,约 156GB,混合精度)
- 部署规模:4 张 H800(TP4)即可完整跑
1. 下载模型
使用 ModelScope 将模型下载到本地。大文件下载建议绕过本地代理,避免代理限制大文件并发导致极慢:
```bash
env -u HTTP_PROXY -u HTTPS_PROXY -u http_proxy -u https_proxy \
-u ALL_PROXY -u all_proxy \\
uv run --python 3.1...