苏达克 (@Sudark) 在 OAI 的训练方式和架构是不是很难迈出下一 大步 ? 中发帖

预训练大模型,再通过强化学习 增加推理时计算继续提高能力. 

这种结构是不是会导致一步错步步错的窘境: 
正确性、格式、偏好评分都可以成为训练信号。
但理解一个模糊问题、发现用户前提错误、判断什么时候该直说,往往更难准确计分。

OpenAI 的强化学习微调文档也明确提醒:模型可能学会获得高分,却没有真正答对。

正确回答问题 却 不能解决问题 。
我已经不是第一次发现GPT把问题润色一遍再还给回来了。 

你可以在下图中找出GPT模型吗? 


提问:为什么OpenAI会变成今天这样 
[8a9add42736ea5ae708c8f73b1220c10]

从左到右依次是 Claude Gemini GPT 
Gemini的模型确实老了3.1Pro,但文章的引力依旧, 
Claude则侧重填充内容信息密度。 
GPT我一时半会不知道他是在做检讨还是帮我细化问题让我好好想想。 
如果O...
 
 
Back to Top