Barry (@BarryYan) 在 A800 + Qwen3.8-27B + vLLM + Caddy 网关部署记录:单卡 256K 上下文与 OpenAI-compatible 接入 中发帖
A800 + Qwen3.8-27B + vLLM 推理服务部署记录
看到站里有佬发了 5090D + SGLang + WSL 的部署记录,我这边刚好走的是 vLLM 版本,环境是单张 A800 80GB,目标不是公网商业服务,而是给自己几台可信设备用一个 OpenAI-compatible API。
一、环境概况
项
配置
GPU
NVIDIA A800 80GB
模型
Qwen/Qwen3.8-27B
引擎
vLLM 0.29.0
精度
BF16,未量化,未 CPU offload
上下文
原生 262,144 tokens
并发
max_num_seqs=1
本地推理端口
127.0.0.1:8000
管理网关
Caddy 127.0.0.1:6008
客户端入口
SSH tunnel 到本机 127.0.0.1:18000/v1
...