@ANG.eth 在 想请教 Codex / 编程 Agent 的用法 中发帖
场景:已有原型,一次能列出 10~15 个 bug 或改进点。我在 Codex 开目标模式(/goal),让它自己干。经常跑一个多小时,它宣布完成并停掉。我再测,很多条根本没做完,或者只做了一半。
我试过/看到过 Sol Advisor、Superpowers 这类规划-编码-审核框架,也想过「干完再开一个审核 subagent」。但项目并不复杂,这些框架感觉偏重,token 也容易被流程吃掉。
核心疑问:
假完成是不是因为一次目标太大、会话太长,而不是缺审核角色?
正确做法是不是:清单写成文件,一次只丢 1 条(最多几条同类小修补),做完再新开只读任务对照清单打 done / missing / partial?
同一会话里再起审核子 agent,到底有没有用?会不会继承「已经做完了」的偏见,而且审 diff 审不出「根本没改的条目」?
你们实际怎么处理「一堆小问题要扫完」?...