小米 MiMo-V2.6-Flash 开源:309B 参数只激活 15B,1M 上下文还带多模态
开源大模型的竞争,早就不是“谁参数更大”了,而是“谁能用更少的激活参数做出更强的能力”。小米新开…
文章目录
开源大模型的竞争,早就不是“谁参数更大”了,而是“谁能用更少的激活参数做出更强的能力”。小米新开源的 MiMo-V2.6-Flash,把这句话讲得很清楚:总参数 309B,却只激活 15B;支持 1M token 上下文,原生处理文本、图像、视频和音频。
一分钟速览
- MiMo-V2.6-Flash 是小米 MiMo-V2.6 系列中的效率均衡版本。
- 基于稀疏混合专家(MoE)架构,总参数 309B、激活参数 15B。
- 支持 1M token 上下文。
- 原生处理文本、图像、视频和音频,属于多模态基座模型。
- 面向“规模化强化学习驱动自我改进”,一次混合 RL 完成多目标优化。
MoE 为什么是当下的主流选择
稀疏混合专家的核心思想是“用得起的大”。总参数做到几百 B,意味着模型有能力容纳海量知识;而每次推理只激活其中很小一部分(这里是 15B),意味着成本可控、速度能接受。对开源社区来说,这是一种“既有上限、又能落地”的折中。
1M 的上下文窗口则意味着它能一次处理超长文档、长视频转写、大规模代码库。过去需要切片拼接的任务,现在有机会一次吃下。
多模态与自我改进
原生多模态比“外挂式”拼接更有优势:模型在训练阶段就见过文本、图像、视频、音频,理解更连贯。而“规模化的强化学习驱动自我改进”则透露出另一个方向——不靠人写更多数据,而让模型在 RL 中自己变强。一次混合 RL 同时优化多个目标,是效率与效果兼顾的尝试。
趋势洞察:开源模型的“效率军备”
从密集模型到 MoE,从单一文本到原生多模态,开源模型的竞争焦点已经转向“单位算力产出”。谁能用更少的激活参数、更低的价格,做出接近闭源旗舰的效果,谁就能赢得开发者和企业。
小米以硬件公司身份进入开源大模型战场,也说明模型的“通用基础设施”属性越来越强——未来它可能内嵌进每一台设备,而不只是一个云端服务。
更值得关注的是“效率均衡”这个定位。它没有一味堆参数,而是在能力与成本之间划了一条线,瞄准的是高频调用、对价格敏感的场景。对希望在本地或私有环境跑模型的企业来说,这种“够用且便宜”的版本,往往比旗舰更有吸引力。开源的意义也在这里——它把选择权交还给了使用者。
本文地址:https://www.163264.com/16127