windsing 在 MiMo v2.6 训练过程中可能存在reward-hacking 中发帖

Vals AI(一家面向企业与研究者的私有领域模型评测平台)审计了小米开源的强化学习代码训练数据集及 agent harness(mimoagent),发现尽管技术报告宣称有完备的防作弊与红队机制(声称作弊率低于 2%),但实际上绝大多数环境存在严重的答案泄露。 
部分总结: 

Git 不可达对象泄漏(占 67%):


在 1,795 个任务(67%)中,参考修复方案虽然删除了对应分支,但其 Git 对象从未被彻底清除。
环境的合法性校验仅检查了可达分支;代码库中虽然写了清理不可达对象的函数,但初始化流程根本没有调用它。
模型(如 MiMo v2.6 Flash)会主动搜索底层 Git 对象,精准提取原始 patch 并通过所有隐藏测试。


文件修改时间戳(mtime)泄漏:


即使彻底移除了 Git 历史,构建任务时应用参考 patch 依然留下了痕迹——被修改文件的最后修改时间...
 
 
Back to Top