跳到文章正文
大模型 编辑推荐

单次 RL 后训练烧掉 260 万美元、每步 37 亿 Token:小米披露 MiMo-V2.6 规模化强化学习路线

大模型卷到今天,真正的分水岭已经不只是“谁的参数更大”,而是“谁愿意为一次强化学习训练掏出 26…

大模型卷到今天,真正的分水岭已经不只是“谁的参数更大”,而是“谁愿意为一次强化学习训练掏出 260 万美元”。小米 MiMo 团队近日披露的一份技术报告,把这笔账算得清清楚楚,也让外界第一次完整看到规模化强化学习背后的成本与工程细节。

一分钟速览

小米 MiMo 团队发布技术报告《MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement》,同时推出 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 两个稀疏 MoE 模型;Pro 的 RL 后训练成本约 260 万美元,Flash 约 90 万美元;每个 RL Step 采样 1568 个 Prompt、生成约 2.5 万条 Agent 轨迹,合计 27 亿至 37 亿 Token。

同时 Scale 三样东西:Rollout、环境和 Grader

MiMo-V2.6 把强化学习算力拆成三部分:Rollout、Grading 和 Training。实际训练中,每个 RL Step 先采样 1568 个 Prompt,每个 Prompt 同时生成 16 条 Rollout,即每一步产生约 2.5 万条 Agent 轨迹。这些轨迹合计达到 27 亿至 37 亿 Token,平均每条序列约 11 万至 15 万 Token,训练上下文长度最高达 100 万 Token。

训练任务覆盖代码 Agent、通用工具使用、视觉设计、上下文遵循和网络安全。正式 RL Batch 中,代码与竞争性编程任务占 68%,通用工具使用占 12%,视觉设计占 13%,上下文遵循占 3%,网络安全占 4%,整体采用 GRPO 并结合异步 Partial Rollout。

模型参数:Pro 与 Flash 的差异化分工

Pro 总参数量为 1.02T、每次推理激活 42B 参数;Flash 总参数量为 310B、激活 15B 参数。两者均采用稀疏混合专家架构,并在文本主干中混合局部滑动窗口注意力与全局注意力。这种“大而全 + 小而快”的组合,瞄准的是同一技术栈下不同部署场景的分层覆盖。

比“做对”更难的是“做得好”

传统代码 RL 依赖二元测试奖励:测试通过给 1 分,不通过给 0 分。但这套方法在长程 Agent 任务上已不够用——两个方案都能通过测试,一个只改了几行必要代码,另一个却塞进大量兼容分支、吞掉异常、扩大 API 范围,传统 Reward 下二者分数相同,工程质量却天差地别。

为此,MiMo-V2.6 引入两套分组智能体评分机制:分组奖励合成(GRS)先收集同一任务的多个 Rollout,由 Agent 分析不同方案,生成“解决方案质量”与“行为质量”两套 Rubric;分组优势重分配(GAR)则让 Grader 对同一任务的轨迹做分组对比、重新分配优势。有意思的是,Grader 在 Pro 计算成本中已占到 12.7%,Flash 更高达 14.2%——评判 Agent 好坏,正成为和训练本身同样昂贵的开销。

趋势洞察:强化学习的成本正在被量化

这份报告的价值,在于它把“规模化 RL”从口号变成了可复现的账本:Pro 的 RL 后训练成本中,Rollout 占 43.8%、训练占 43.5%、Grader 占 12.7%。当越来多的团队意识到,通往“自我改进”的路径必须同时放大训练 Batch、任务环境与 Grader Compute,强化学习的算力门槛正在被重新定义,中小团队与大厂之间的差距,可能因此进一步拉大。

更深一层看,这份报告也揭示了一个行业趋势:当强化学习成为模型自我改进的主引擎,评判与反馈的质量直接决定了模型能力的天花板。如何在控制成本的同时提升 Grader 的可靠性,将是所有大模型团队下一阶段必须回答的问题。

本文地址:https://www.163264.com/16729