单次 RL 后训练烧掉 260 万美元、每步 37 亿 Token:小米披露 MiMo-V2.6 规模化强化学习路线
大模型卷到今天,真正的分水岭已经不只是“谁的参数更大”,而是“谁愿意为一次强化学习训练掏出 260 万美元”。小米 MiMo 团队近日披露的一份技术报告,把这笔账算得清清楚楚,也让外界第一次完整看到规模化强化学习背后的成…
主题标签
大模型卷到今天,真正的分水岭已经不只是“谁的参数更大”,而是“谁愿意为一次强化学习训练掏出 260 万美元”。小米 MiMo 团队近日披露的一份技术报告,把这笔账算得清清楚楚,也让外界第一次完整看到规模化强化学习背后的成…