hey_halcyou (@QuanTiZaing) 在 自部署Qwen3.8-27B-FP8,使用vllm推理,占用两张H800显存,推理耗时很慢这是为什么 中发帖
[图片]
这是我通过axonhub经过测试的耗时,问一个问题回答的太慢了。理论上这是一个供3090的24GB显存使用的模型,我都使用H800 80GB显存为啥还是这么卡,这不合理呀。