朗风 (@lwind233)有佬知道DeepSeek是怎么进行测试的吗? 中发帖

主要是这个automationBench,看huggingface上的结果,这里面声明用的是公开集,将GLM5.2的运行通过率标注为12.9% 
 [image] 
而AutomationBench仓库里的公开集中将GLM的运行通过率标注为26.17% 
[image] 
我自己用这个仓库的框架测出来DeepSeekv4-flash的结果大概是35%左右,本来想测试下跑评测这个流程有没有问题,现在也不知道是我自己测的过程有问题,还是DeepSeek用了比较老版本的数据集。主要这个差距也太大了 😂
 
 
Back to Top