苏达克 (@Sudark)新模型让人兴奋、也让人郁闷。 中发帖

这篇文章在夏天那会就冒了头,
但很可惜当时我没能被互联网照顾,现在看看,确实,远见十足。 

知乎文章 

https://zhuanlan.zhihu.com/p/2035668823311898252 

原论文 



这是 ProgramBench ,它给模型一个可执行程序及文档,让模型自行选择语言、设计架构、编写代码,复现原程序的行为。可以运行原程序观察结果,但不能看源码、反编译或联网。200 个任务包含小型命令行工具,也包含 SQLite、FFmpeg 等大型软件。 
测试结果很吸引人,
 [image] 
那么到今天呢?




模型
完全通过全部测试
≥95% 测试通过的项目比例
平均测试通过率
单项目平均成本




Claude Fable 5.1
7.0%14 个)
53.5%
82.7%
$58.52


GPT-6 Astra
5.5%11 个)
50.0%
8...
 
 
Back to Top