小诗音 (@mingliao)测试一下哪个模型适合当主力模型的协作模型 中发帖

在我日常使用Claude的过程中,我发现Opus等模型在细节实施的过程中表现经常不太好,但是整体的规划能力还是比较出色的。 
于是我尝试了让Claude在一个任务需要具体编码的时候,利用各种harness cli的非交互模式来负责具体的实施。 
也就是Opus 5/Fable 5做整体的分析、规划,一些更快、更小的模型来负责具体的编码、测试等,既节省了成本,又让整体的质量得到了保证。 
但是,各个模型在和Claude模型配合的时候,质量、速度表现差距是比较大的,于是我用我们线上仓库创建了多个worktree,选用线上一个真实存在的issue和Opus的分析作为输入,由各个模型自己分析实现方案,再用review的结果作为验收标准,与此同时,会有opus-5和gpt-5.6-sol-max两个模型的实现作为对照。 
目前仅列出我实际尝试过的几个模型 
一、速度表现 




模型
修复耗时
文...
 
 
Back to Top