苏达克 (@Sudark) 在 新模型让人兴奋、也让人郁闷。 中发帖
这篇文章在夏天那会就冒了头,
但很可惜当时我没能被互联网照顾,现在看看,确实,远见十足。
知乎文章
https://zhuanlan.zhihu.com/p/2035668823311898252
原论文
这是 ProgramBench ,它给模型一个可执行程序及文档,让模型自行选择语言、设计架构、编写代码,复现原程序的行为。可以运行原程序观察结果,但不能看源码、反编译或联网。200 个任务包含小型命令行工具,也包含 SQLite、FFmpeg 等大型软件。
测试结果很吸引人,
[image]
那么到今天呢?
模型
完全通过全部测试
≥95% 测试通过的项目比例
平均测试通过率
单项目平均成本
Claude Fable 5.1
7.0%(14 个)
53.5%
82.7%
$58.52
GPT-6 Astra
5.5%(11 个)
50.0%
8...