William (@Lee_William)多个最强模型静态分析能力评测 中发帖

现在论坛上很多人都没有自己的基准测试, 都只是用鹈鹕之类的进行测试, 这样的测试好处是个小学生都看得出来好坏, 但比较局限在视觉上, 现实中, 尤其是写代码时, 更重要的其实是推理能力, 很多实际场景也是修改bug, 添加功能, 迁移代码的场景. 
之前都是写demo, 现在在研究一个模型的理解和分析能力. 
测试用之前编写的有问题的着色器学习的demo(GLM 5.3最喜欢写小bug), 大概10K token的代码量, 错误不算难的数组溢出小bug, 藏得不深但, 使用模糊指令:“找出代码是否有问题”, 让模型在静态分析下找到问题, 发现很有意思的情况: 




模型名称
测试结果
备注




GLM 5.3
失败
-


GPT 5.6 SOL
失败
-


Grok 4.6
成功
非常不稳定,有时成功,有时乱输出像傻子,匪夷所思


Deepseek 4 Pro
失败
经常思考...
 
 
Back to Top