hey_halcyou (@QuanTiZaing)两张A800卡,适合部署什么样的模型呢,求大佬推荐!! 中发帖

目前公司有两张a800卡处于离线状态于是就想将它废物利用部署一个模型供自己或者小组的人使用。 
目前已经尝试过qwen3.8+sglang 可以达到150+ t/s(说实话这个模型整理小文档,以及统计一些代码轻量的活还是不错的,但是有时候也会流口水🤤,但是快是真的快)。 
后续又尝试过glm5.3-flash-gguf-q4版本,虽然可以部署代码吐字速度太慢了就20 t/s ,再就是deepseek-v4-flash-gguf好像也是4比特版本,也是存在一样的问题gguf吐字速度根本没办法跟qwen3.8-27b比,主要太慢了个人使用都不满足,遂放弃,还是使用qwen3.8-27b的方案。 
后面看到又新出了一个exl3量化方式,于是又起心思想部署一个qwen3.8-flash-next版本,因为对比起来原始权重是180b的可能速度要快一些。但是也确定,所以想看看有没有佬有同样的配置可以推...
 
 
Back to Top