Light (@sgsdxzy)有人在说开源模型降智可能部署了量化版本,可是哪来的量化版本 中发帖

现在能卖得出去的模型,只有glm-5.2有bf16 vs fp8 vs nvfp4三个版本,官方api在openrouter上显示是fp8,别的地方最多降到fp4,应该没人会用bf16的。 
kimi-k3和deepseek-v4都基本上是fp4的模型权重了(deepseek的非moe部分是fp8),发行就是最低精度的QAT了,没有地方可以降了啊? 
还有一种情况是把fp4 requant成gptq/awq int4,但是首先在B300上fp4本来就是最快的格式;在Hopper及以前的显卡上fp4和int4都不是native precision,都需要marlin或者flashinfer kernel,两者速度不会有很大差别。requant得不偿失 
什么GGUF在大规模部署常见下就是浪费显卡,不可能的。 
所以我很好奇这种观点下,他们在用什么版本部署?
 
 
Back to Top