@Owen01 在 gpt-6 让大参数 coding 模型的趋势越来越明显 中发帖
sora 的时候我预测了 gpt-6 会是继fable 之后的新一代大参数量的基座模型。
fable 开启了以 coding 能力为主的大参数基座模型的纪元,它的终极目标很明确,即让模型有自迭代的能力,最契合的就是 coding 能力。
其他家那个时候还处于刚刚使用 coding 优化的 chat 基座模型,所以我那个时候就预测 sora 是 5 系最后一代模型,真正意义上的 coding 模型是从 6 开始的,果不其然。
反推这个时间其实是最为恐怖的,3 个月下线一个大参数模型。。。。
所以我预测蒸馏会需要比之前更长时间,国产没有太多算力卡。而大参数 coding 代价就是消耗大量算力,从 fable 就可以看出来,当然 OpenAI 拥有更多算力会一定程度上减轻这个趋势。
现在的一个问题是:大基座模型的向下蒸馏到底在实际应用上会复现多少能力,我们都知道目前通过蒸馏就能很好训练...