比卡丘 (@yixiaochuan) 在 难怪国产模型会被低估和轻视,原来如此 中发帖
事因是昨天在L站看到佬发帖说国际版workbuddy(后称wb) deepseek-v4.1f(后称ds) 免费。
我马上就去领赛博鸡蛋开始用。
结果就是:
[image]
国产比较几大头部模型都是开源,D老师、glm、qwen、kimi等,
这是好事,但是副作用也很大。
很多公司、中转站也部署,然后免费、低价的给别人用。
但是你不知道它部署的是满血的还是Q8 Q4 甚至Q3,
最要命的其实是kv cache的量化,我觉得这个才是量化重灾区。
因为了解一点本地部署的都知道,多人使用并发,kv占用显存甚至比模型本身大得多。
现在这些模型动不动就是1M最大上下文,真用满一个用户那就是120G显存。
kv量化之后就会出现如图的效果了…
不止wb,opencode go(后称opg)也是这样,但是暂时没遇到这么离谱的情况。
opg是降速和降智力了。wb是速度300t/s,...