𝐴𝐼𝐺𝐶𝐹𝑅𝐸𝐸 (@AIGCFREE)Xiaomi MiMo-V2.6发布:扩展强化学习规模,迈向自我提升 中发帖

今天,我们正式发布并开源 Xiaomi MiMo-V2.6 系列。这是我们探索 RSI(递归自我改进)路径的关键一步:以可验证的复杂任务为基础,规模化扩展强化学习(RL)算力,让模型在持续的探索与反馈中不断拓展智能边界。 
夫夷以近,则游者众;险以远,则至者少。在一个智能容易被复制的时代,我们选择把算力投进真实环境,让模型在反馈中一次次试错、自己学会。这条路更慢,也更少被看见。MiMo-V2.66 天的 Live RL 训练,是我们在这条路上的一次公开跋涉;而这 6 天的背后,是长达半年的基础研究积累和工程试错。 
 [c50b96b85a1a8749af4e865ea7394f62] 
MiMo-V2.6 系列包含 Pro 和 Flash 两个原生全模态模型。得益于 RL 算力的扩展,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence ...
 
 
Back to Top