Barry (@BarryYan)A800 + Qwen3.8-27B + vLLM + Caddy 网关部署记录:单卡 256K 上下文与 OpenAI-compatible 接入 中发帖

A800 + Qwen3.8-27B + vLLM 推理服务部署记录
看到站里有佬发了 5090D + SGLang + WSL 的部署记录,我这边刚好走的是 vLLM 版本,环境是单张 A800 80GB,目标不是公网商业服务,而是给自己几台可信设备用一个 OpenAI-compatible API。 
一、环境概况




项
配置




GPU
NVIDIA A800 80GB


模型
Qwen/Qwen3.8-27B


引擎
vLLM 0.29.0


精度
BF16,未量化,未 CPU offload


上下文
原生 262,144 tokens


并发
max_num_seqs=1


本地推理端口
127.0.0.1:8000


管理网关
Caddy 127.0.0.1:6008


客户端入口
SSH tunnel 到本机 127.0.0.1:18000/v1

...
 
 
Back to Top