StarFox一个暴论:未来最有效的Benchmark,其实是一句话 prompt 中发帖

有一个想法,很想提出一句暴论:未来真正能够校验 AI intelligence 和 agentic 能力的 benchmark,最应该是一句话 prompts 
看到了 OpenAI 最近对于其 Astra 内部模型做数学题的论文,主要就是说 Astra 模型已经能够解决很有含金量的数学问题。 
这当然是宣传上的事实,但实际上不可否认,Astra 模型在内部确实有助力,但更多的其实是靠数学家和数学从业者提供十分精确的 prompt 作为引路方向。这也就是说,如果按照严格的“AI 独立解决”来衡量,这其实不算。毕竟理想中的 AI 独立解决,应该是我们直接告诉 AI 去解决某个数学问题,然后 AI 自己想办法、自己去做,总之最后能拿到解决问题的结果就行。 
于是我就想,如果我们派给一个真正的人一项任务,理论上来说,我们不需要说很多,一句话告诉他任务目标,他就应该能完成。AI 是不是也是这个原理...
 
 
Back to Top