zaodianshuijiao 在 opus5幻觉似乎挺严重的,爱拍脑袋下决定--多agent协作下的数据统计 中发帖
做了一个多agent协作项目,主要的协作方式是Claude派发任务给codex,claude(leader)负责与我交流并编排实现、写任务书与验收标准,codex分两类,一类是开发一类是qa做验收测试。这个合作模式从opus4.6开始一直让我挺满意,就像是用codex额度给claude额度续命了,两个满配账号就能一直跑一直跑。直到最近换成opus5,让我体验到了当初让gpt5.6sol-max来当leader的体验(gpt5.6刚出的时候试跑了一整天,不断派发调查,钻细节,一整天一个需求都没做),opus5效果类似,一个功能要大半天才能真正落地,但他不是一直在调查,而是不断自我否定,大概就是:【leader拍脑袋–>派发任务–>gpt否定–>leader认错又继续拍脑袋…】,直到compact,然后开启新一轮的循环。于是我查了一下近期工作记录。数据如下供各位佬参考:
[image]