@lopez对主流的几种coding model一次测试,包括GPT 5.4、GPT 5.6 luna、Deepseek v4 flash正式版、Claude sounet 4.6 中发帖

作为coding model,核心是理解现有代码库、准确遵循需求、代码质量稳定、使用工具能力强、低幻觉、低越界、上下文大、成本与速度优秀等等。想着Deepseek v4 flash正式版出来了,也想测试一下。 
本次测试使用GPT-5.6-SOL(high)出题,题目简单要求为: 
实现一个仅使用 Python 标准库的本地任务编排器 ForgeLite:读取 JSON 工作流,根据任务依赖和并发上限执行命令,并支持变量替换、失败重试、超时、增量跳过、Dry Run、SIGINT 取消及原子 JSON 报告。 
题目有些难点,例如要求正确处理依赖图、并发调度、失败阻塞和无关分支继续执行;实时区分并转发 stdout/stderr,同时可靠管理多个子进程,超时或 Ctrl-C 时必须终止整个进程树,包括忽略 SIGTERM 的顽固后代等等不一一列举。 
分开4个独立区间,每个独立区间给  I...
 
 
Back to Top