TOTDeepSeek Harness的过拟合问题测试 中发帖

前面已经测试过了deepseek-v4-pro模型Max思考在dsh和oc中的表现,近期部分佬友在讨论dsh和过拟合问题。遂进行部分测试,并列出思维链的统计信息。测试均使用Deepseek-v4-pro模型Max思考。 
测试项目有五个: 


Macos平台dsh:标准模式、提示词修复模式 


Linux平台dsh:极简模式、极简模式(英文提示词) 


Opencode Pure模式 


对照组有一个: 

kimi-k3(使用Kimi客户端测试)

先贴测试汇总信息
不同测试项的思考块关键词统计 
 [图片] 
不同测试项的运行指标 
 [图片] 
对照组结果:
1. Kimi-k3

使用Kimi客户端Work模式,开启极致思考,开启1M上下文 

预览链接 
 [图片] 
测试结果:
1. DSH-Mac平台-标准模式
预览链接 
 [图片] 
初始思维: 
 [图片] 

2...
 
 
Back to Top