风云 (@FengYunCalm) 在 关于Moe和稠密模型,涨知识了 中发帖
一直刷到qwen3.8-27B比dsv4f强
我还以为我的白月光烂掉了
然后阅读时发现"稠密模型"四个字,和以前看到的Moe不一样,去了解了一下,才发现并非如此
分享给各位佬友
Moe虽然宣传起来参数量大,但是真正激活的参数量往往极小于参数量,而模型工作能力精度取决于激活量
稠密模型则是有多少激活多少
比如说300B的dsv4f,激活30B
那么能力和27B的qwen差不多情有可原啊
然后Moe没激活的那些,其实就是知识了,可以让模型广度强于稠密模型
可以理解为Moe是一颗大脑加上一堆学习的知识
稠密则是一颗大脑