linjinpeng实测Openai内部有碾压fable和gpt-5.6-sol的模型 中发帖

在arena中测试题目:gpt-5令人失望 
此题目虽然fable和gpt-5.6-sol等旗舰模型可以完全正确解出,但是需要消耗大量的时间进行内部推理 
而实测一个未知的匿名模型在无需任何推理的情况下,仅简答调用三次python脚本作为辅助,即可在1分钟内解出此题,此模型经过识别为Openai提供 
 [image]
 
 
Back to Top