我秦始皇? (@wo_zu_long) 在 GPT 6不一定是AGI时代的开始,但是一定是蒸馏时代的结束 中发帖
根据《The Information》的独家爆料,GPT-6 采用了一项名为循环深度的新技术。这项技术到底是什么呢?目前大家接触到的大模型,包括 Claude Fable 在内,普遍依赖“显式思维链”(CoT)——也就是必须把每一步思考和推理的过程,都像打草稿一样逐字生成为人类可读的文本 Token。而 GPT-6 则是在模型的内部连续隐藏状态中直接完成多步推理,中途不需要生成任何多余的过渡文字。
这次 GPT-6 更强的智能涌现也正是来源于此。据预测,它的模型参数量应该比 Claude Fable 低很多,却能达到同等的智能水平。不过今天我们想探讨的核心,是这项技术背后引发的另一个严峻话题:
仅仅预训练一个基础底座模型,然后用国际旗舰模型的输出数据做后训练,就能轻松达到行业顶尖(SOTA)水平的时代,是不是已经彻底结束了?
首先,我并不批判这种做法。这种行业内常见的“蒸馏”行为...