苏达克 (@Sudark) 在 OAI 的训练方式和架构是不是很难迈出下一 大步 ? 中发帖
预训练大模型,再通过强化学习 增加推理时计算继续提高能力.
这种结构是不是会导致一步错步步错的窘境:
正确性、格式、偏好评分都可以成为训练信号。
但理解一个模糊问题、发现用户前提错误、判断什么时候该直说,往往更难准确计分。
OpenAI 的强化学习微调文档也明确提醒:模型可能学会获得高分,却没有真正答对。
正确回答问题 却 不能解决问题 。
我已经不是第一次发现GPT把问题润色一遍再还给回来了。
你可以在下图中找出GPT模型吗?
提问:为什么OpenAI会变成今天这样
[8a9add42736ea5ae708c8f73b1220c10]
从左到右依次是 Claude Gemini GPT
Gemini的模型确实老了3.1Pro,但文章的引力依旧,
Claude则侧重填充内容信息密度。
GPT我一时半会不知道他是在做检讨还是帮我细化问题让我好好想想。
如果O...