湍流 (@fluxar)今晚上真热闹,两家flash模型都赶今晚上发布了 中发帖

[image] 
[image] 
-GLMflash,个人体感是小激活参数MOE模型,代码特化,在训练范围内的定式问题解决能力优秀。简单测试了下糖果题、色盲题,还有自己的一些评测小题库,非代码综合能力上方面大概是qwen3.6-27B的水准。有虽然泛化逻辑方面较弱,但是前端表现力方面确实令人惊艳,拭目以待 
-Qwen3.8-Flash-Next,新的架构(官宣是qwen4下一代尝鲜版本),125B模型主体+51BN-gram嵌入表,总计176B,每token激活6B。希望不要重演上一代Qwen3-coder-next惨剧()
 
 
Back to Top