比卡丘 (@yixiaochuan) 在 难怪国产模型会被低估和轻视,原来如此 中发帖

事因是昨天在L站看到佬发帖说国际版workbuddy(后称wb) deepseek-v4.1f(后称ds) 免费。 
我马上就去领赛博鸡蛋开始用。 
结果就是:
 [image] 
国产比较几大头部模型都是开源,D老师、glm、qwen、kimi等, 
这是好事,但是副作用也很大。 
很多公司、中转站也部署,然后免费、低价的给别人用。 
但是你不知道它部署的是满血的还是Q8 Q4 甚至Q3, 
最要命的其实是kv cache的量化,我觉得这个才是量化重灾区。 
因为了解一点本地部署的都知道,多人使用并发,kv占用显存甚至比模型本身大得多。 
现在这些模型动不动就是1M最大上下文,真用满一个用户那就是120G显存。 
kv量化之后就会出现如图的效果了… 
不止wb,opencode go(后称opg)也是这样,但是暂时没遇到这么离谱的情况。 
opg是降速和降智力了。wb是速度300t/s,...
 
 
Back to Top