Zeroth 在 使用 GPT 5.6-Sol 开发遇到的问题 中发帖
GPT 5.6-Sol 的执行力很强,能非常好的遵循指令,但是我认为差也就差在这里。
Skill/指令 强固化。 Skill的每一条步骤他从不校验是否有必要,直接按字面意义强制执行,一个步骤也不差。我开发了一个skill,要求"在开发前查询依赖版本",结果他每次对话(哪怕开发已经开始了)都强制执行这个步骤,不仅没用而且占据上下文空间,要知道GPT5.6的上下文窗口本就很紧张。
存在欺骗/偷懒行为。 如果你用过Codex,你会发现GPT5.6 几乎每一个修改都会写一个对应的测试。看上去很安全不是吗?我一开始也是这么认为的(对应的,Claude几乎从来不写测试)。我使用GPT开发了一个pathfinder,我发现他在作弊——他的测试大部分都是已固化场景,而GPT会针对这个已经固化的场景不断fine-tuning相关参数——根本就不可靠,而在实际测试中也确实如此。 更严重的是他自己永远无法发...