风云 (@FengYunCalm)关于Moe和稠密模型,涨知识了 中发帖

一直刷到qwen3.8-27B比dsv4f强 
我还以为我的白月光烂掉了 
然后阅读时发现"稠密模型"四个字,和以前看到的Moe不一样,去了解了一下,才发现并非如此 
分享给各位佬友 
Moe虽然宣传起来参数量大,但是真正激活的参数量往往极小于参数量,而模型工作能力精度取决于激活量 
稠密模型则是有多少激活多少 
比如说300B的dsv4f,激活30B 
那么能力和27B的qwen差不多情有可原啊 
然后Moe没激活的那些,其实就是知识了,可以让模型广度强于稠密模型 
可以理解为Moe是一颗大脑加上一堆学习的知识 
稠密则是一颗大脑
 
 
Back to Top