小米把强化学习训练“摊开”了:MiMo‑V2.6开放万亿参数模型、7000多个环境与完整RL框架

小米发布MiMo‑V2.6系列,包括万亿参数的Pro和更强调成本效率的Flash。两款模型均可处理文本、图像、视频和音频,支持100万Token上下文,重点面向长时间编程、工具调用、电脑操作和多模态Agent。相比常规发布,这次更值得关注的是训练过程:小米为两款模型分别进行了约75万条轨迹的混合强化学习,将编程、通用Agent、视觉和网络安全任务放进同一次训练,并用模型比较多条成功路径,不再只靠“通过/失败”打分。训练不到六天,Flash与Pro的公开成本分别约为85万和262万美元。第三方Artificial Analysis将Pro评为当前得分最高的开放权重模型,但它并非全面超过闭源前沿模型,部分终端操作和网络攻防测试仍有明显差距。小米同时发布MIT许可权重、9B蒸馏模型、技术报告、7000多个RL环境及训练框架,为外界研究“扩大强化学习能否持续提升Agent”提供了少见的完整样本。

文章作者、来源:Xiaomi MiMo

两个模型,面向同一种长时间Agent工作

MiMo‑V2.6‑Pro采用稀疏混合专家架构,拥有1.02万亿总参数,每个Token激活约420亿参数;Flash为3090亿总参数、激活约150亿参数。两者均支持100万Token上下文,能够接收文本、图像、视频和音频,还配有五层多Token预测模块,用于加速生成。

这里的“原生全模态”主要描述输入理解能力。公开权重当前以文本生成为主要输出形式,并不意味着模型能够直接生成图像、视频或自然语音。官方展示的短片、演示文稿、音乐和3D场景,很多是模型通过写代码、操作软件及调用外部生成工具完成的。

Pro追求能力上限,Flash则试图以更低推理成本处理同类任务。API价格为每百万Token:Flash输入0.14美元、输出0.28美元;Pro输入0.435美元、输出0.87美元。官方还提供Pro UltraSpeed,宣称质量不变、输出速度最高提升20倍,但其输入和输出价格也相应提高到4.35美元和8.70美元。这项“同质量”说法尚缺少独立复测。

虽然权重采用MIT许可,两款主模型都远超普通消费级硬件能够轻松部署的规模。“开放权重”解决的是检查、修改和自行部署的许可问题,并不代表个人电脑可以低成本运行。

真正的新意是把四类任务放进同一次RL训练

以往团队经常分别训练编程模型、视觉Agent和网络安全模型,再尝试合并能力。小米将这种方法概括为“You Only RL Once”:编程、通用Agent、视觉操作和网络安全任务,以及多种Agent运行框架,被混合进同一个强化学习批次。

每个训练步骤包含1568个提示,每个提示生成16条运行轨迹,相当于约2.5万条轨迹;两款模型各完成30步,所以每个模型累计约75万条轨迹。单步处理约35亿至37亿Token,最长任务可以占满100万Token上下文。

整个过程不到六天。Flash的训练成本约85万美元,Pro约262万美元。训练任务平均通过率分别相对提高约25%和12%。在未用于训练的DeepSWE v1.1长时间软件工程测试上,Flash从约48.8分升至65.7分,Pro从58.4分升至72.6分。

模型不只判断“成功没有”,还比较哪条成功路径更好

长时间Agent训练面临一个问题:单纯的单元测试通常只能告诉模型任务是否完成,却无法区分两条都能通过测试的路线。一个Agent可能迅速定位错误并修复,另一个则可能进行上百次无关搜索,最后偶然得到相同结果。

MiMo‑V2.6加入了组内Agent评分。系统先比较同一任务生成的多条轨迹,构建针对该任务的评分规则;在线训练时,再对已经成功的轨迹排序,将更多学习信号分配给质量更高、路径更短、Token消耗更少的方案。

小米把这种由模型自身样本产生比较信号的机制称为“自我改进闭环”。但它并不是模型部署后脱离人类持续修改自身:训练环境、任务、验证器、奖励结构和算力仍由研究团队提供,权重也通过正式训练流程更新。

随着训练规模扩大,团队还冻结了混合专家路由器,降低不同训练与推理环境间的漂移,并通过对抗评测、异常检测、环境加固及多个验证器交叉检查,减少Agent钻评分漏洞的机会。训练完成后,MOPD²蒸馏方法还会复用教师轨迹和人工示范的历史前缀,集中训练关键决策点,而不必每次重新生成完整任务历史。

第三方综合榜领先,但单项能力并不全面占优

Artificial Analysis给予MiMo‑V2.6‑Pro约46分,使其成为当时该机构得分最高的开放权重模型。官方公开测试中,Pro在DeepSWE v1.1得到71.9分,接近DeepSeek V4.1 Flash和Claude Opus 5的74分,也高于Claude Fable 5的70分。

在AutomationBench中,Pro得到53.1分,略高于GPT‑6 Astra的52.0、Claude Opus 5的50.3和Claude Fable 5的46.2,但稍低于DeepSeek V4.1 Flash的54.8。GDPval‑AA职业任务评分为1673,接近Claude Opus 5的1708。

这些结果不能理解为Pro已经全面超越闭源前沿模型。Terminal Bench 4.0中,Pro只有34.9分,明显低于GPT‑6 Astra的59.6和Claude Fable 5.1的55.1。在ExploitBench网络攻防测试中,Pro为47.9分,而GPT‑6 Astra、GPT‑5.6 Sol及Claude Fable 5分别达到100、78.5和78.0。

部分视觉及网络安全结果还来自小米内部基准,外界无法完全复现;Artificial Analysis的综合指数主要评估英文文本任务,也不能证明模型的音频、视频和机器人能力同样领先。

“Vibe World”把编程扩展到3D世界和机器人仿真

小米把模型从软件生成向外扩展的方向称为“Vibe World”。Agent可以根据文本、图片或视频拆解需求,让多个子Agent共同搭建3D场景、编写交互逻辑、运行渲染,再依据画面检查结果继续修改,最后交付可运行的交互世界。

模型也可以操作Blender生成可用于动画、游戏或3D打印的资产。在机器人仿真中,它接收多个摄像头画面,通过视觉反馈持续控制Franka Panda机械臂,完成抓取、颜色匹配和精确放置。

这些是由官方挑选的演示案例,还不是大规模机器人成功率测试。尤其是仿真环境中的闭环控制,不能直接证明模型在真实机器人上面对摩擦、光照、遮挡和传感器误差时能够保持相同性能。

科研案例有价值,但距离实验确认仍有一步

在材料研究案例中,小米研究人员要求Pro寻找能够吸附PFAS“永久化学物”的新型金属有机框架材料。模型检索论文与专利、提出假设、检查新颖性,再调用开源计算工具搭建模拟环境,计算候选材料与PFAS之间的结合强度,最终筛选出三个值得进入湿实验阶段的结构。

这说明模型可以串联文献检索、环境安装、计算模拟和结果筛选,但候选物目前仍属于计算结果,并非已经在实验室中证实有效的新材料。

另一个案例是形式化数学。研究人员提供探索策略后,Pro通过多个子Agent协作,把Li和Yorke的经典结论“周期三蕴含混沌”写成超过6000行的Lean 4代码。最终证明通过Lean内核验证,不含未完成的占位符;不过官方也明确提到,研究人员随后进行了修订和整合,因此它是人机协作成果,而不是模型从零独立完成整项证明。

开放的不只是权重,也包括训练入口

本次同步发布的内容还包括9B参数的MiMo‑V2.6‑Distill‑Qwen‑9B。它是在Qwen3.5‑9B基础上,用MiMo生成的数据进行监督微调得到的Agent模型,面向编程、通用工具、视觉编程和网络安全,可作为规模较小的RL研究起点。

小米还宣布开放技术报告、7000多个强化学习任务环境、端到端RL框架及可组合的小型Agent运行工具。这比只上传最终权重更有研究价值,因为外界可以检查能力提升究竟来自模型、任务分布、验证器还是Agent框架。

不过,这批资源刚刚发布,尚未经过社区对训练数据完整性、环境可复现性和安全性的系统审计。官方所谓“完整开放”是否足以在其他算力平台重现相同结果,仍需实际运行验证。