舒 克 (@user310) 在 DeepSeek V4 Pro 严重依赖首轮工具锚定,两阶段插件成功复现高分能力 中发帖
社区消融实验揭秘:DeepSeek V4 Pro 严重依赖首轮工具锚定,两阶段插件成功复现高分能力
DeepSeek V4 Pro 正式版发布后,因实际表现不及灰度测试预期而引发社区争议。近日,开源社区通过消融实验探针对其进行了深入分析,揭示了其性能波动的底层机制并给出了解决方案:
V4 Pro 对首轮请求中可见的 API 工具目录(Schema Surface)极度敏感。在暴露完整 25 个工具的 Standard 模式下,模型易陷入低效的 “Let me…” 思维链(CoT)轨迹,Project2 评分仅为 9192 分;而在仅提供 Shell 和 Read 的 Minimal 模式下,模型能被激活为灰测时的 “We need…” 推理轨迹,基准分回升至 9699 分。
针对 Minimal 模式缺失高级工具的问题,社区开源了 dsh-anchored-standard 插件。该...