基围虾 (@wxji) 在 论国模与O/A差距 中发帖

国模与O/A的差距某种程度上是与ANY站的可用程度成反比的(玩笑之举)。有没有佬you深耕 强化学习后训练的,可以给解释下为何在SFT和cot的推理思维链时代,蒸馏没有作为国模追上O/A的主要手段。而在强化学习做后训练后,蒸馏这个词就被提及的这么频繁呢?   难道国内的基模团队不能自己从头搭建强化学习后训练 么?  国内的豆包好像就完全脱离 了这条路,但感觉还是没什么动静的样子 。   还是说大量的优质的数据都掌握在A\ O\ 这类公司的手里
 
 
Back to Top