@Awitl科普:为什么常常用“鹈鹕骑自行车”来测试大模型是否降智? 中发帖

关于“鹈鹄骑自行车”这个测试,之所以被用来快速判断模型是否“降智”,是因为这个古怪离奇的组合几乎不可能出现在训练数据里,模型没法靠死记硬背来应付,必须当场理解鹈鹕的生理特征和自行车的机械结构,并用代码在二维空间里还原出合理的透视关系和动态逻辑。 
社区里逐渐形成了一条不成文的经验:如果模型能画出腿部随踏板转动的周期性踩踏动作,那说明底层模型确实有不错的推理和组合能力,如果画出来的图是静态的、各部件位置错乱,或者回避了运动细节,那大概率是模型掺水。
 
 
Back to Top