Ai2 开源 Olmo-core 3:让 MoE 训练一步跨进“万亿参数俱乐部”
当你在手机上问一个 AI 问题时,背后真正烧钱的部分不是推理,而是训练。模型的参数量越大,需要的…
文章目录
当你在手机上问一个 AI 问题时,背后真正烧钱的部分不是推理,而是训练。模型的参数量越大,需要的显卡就越多、电费就越高,最后只有少数几家大厂才玩得起。当地时间 10 月 1 日,非营利研究机构 Ai2(艾伦人工智能研究所)在 Hugging Face 上发布了 Olmo-core 3,把一套为超大规模“混合专家”(MoE)模型打造的开放训练框架免费放了出来——它的目标很直接:让学术团队和小实验室也能训练出万亿参数级别的模型。
一分钟速览
- Ai2 发布 Olmo-core 3,重写了 MoE 训练系统,可扩展到万亿参数规模。
- 关键指标:专家池从 8 扩到 128、每 token 仍只激活 4 个专家,总容量从 46 亿涨到 470 亿,训练吞吐却只掉不到 5%。
- 在 8 张 NVIDIA B300 上,470 亿参数 MoE 达到每卡每秒 5.2 万 token,是旧实现的约 2.7 倍。
- 启用 MXFP8 低精度格式后,吞吐比 BF16 高约 21%,峰值显存从 103 GiB 降到 95 GiB。
- 已在 512 张 GPU 上跑通 1.2 万亿参数模型,另用 DeepEP v2 摸到 2.38 万亿参数的配置。
为什么 MoE 越大越难训
MoE 的思路是“分工”:模型里塞进很多个专家模块,但每个输入只走其中一小部分,这样就能在总容量暴涨的同时,把每次计算量压在可控范围。听起来很美,问题出在工程上——整个模型仍然要存在显存里,而把数据分发给正确的专家,本身就要付出庞大的通信与协调成本。专家越多,这笔“调度费”就越容易吃掉 MoE 省下来的算力红利。Olmo-core 3 要补的,正是这个洞。
从 FSDP 到 DDP:把专家“钉”在显卡上
上一代 Olmo-core 的 MoE 实现用的是全分片数据并行(FSDP),每批数据都要把权重聚集、再分片一遍。Olmo-core 3 换成了分布式数据并行(DDP):让专家常驻在各自的 GPU 上,把数据路由过去,从而避免反复搬运权重。效果立竿见影——在一项测试里,专家池从 8 个扩大到 128 个,每 token 依旧只选 4 个专家,单 token 激活参数稳定在约 32 亿,但总容量从 46 亿拉到 470 亿,吞吐下降不到 5%。在 8 张 B300 上的初步测试中,这个 470 亿参数的 MoE 达到每卡每秒 52,000 token,而旧实现只有 19,400,约为 2.7 倍。
三招拆分 + 三项优化
框架用三种并行方式把模型和训练状态摊到集群上:专家并行(每张卡只存一部分专家)、流水线并行(把层切给不同 GPU 组)、分布式优化器(优化器状态也不再每卡存全量)。它还专门降低路由成本:行式专家并行把数据直接摆进专家输入缓冲区,GPU 常驻路由让路由元数据留在显卡上,分组 GEMM 则把小而多的专家计算合并起来批量执行。
精度方面,Olmo-core 3 支持 MXFP8。在 4 张 B300、负载均匀分布的受控测试中,开启 MXFP8 后端到端吞吐比 BF16 基准高约 21%,峰值活动显存从 103 GiB 降到 95 GiB,收益主要来自前馈计算和专家间数据搬运,而非注意力部分。
万亿参数:数字与“坑”都公开
Ai2 在 B300 上测了多种配置,其中包括一个 1.2 万亿参数、每 token 激活 583.6 亿参数、横跨 512 张 GPU 的模型,观测到的最高吞吐为每卡 858 TFLOP/s。他们还实验了 DeepEP v2 这条专家间通信路线,摸到了 2.38 万亿总参数的配置——不过这只是短时的容量测试,用来证明框架能触达的规模,而非持续训练性能。
难得的是,技术报告把“试过但没采用”的路径也写了出来:比如一个本意是鼓励负载均衡的评分,可能在真实负载变得更不均衡时反而变好看,他们称之为“token 分配舞弊”;再比如,因为专家处理的 token 少就调低学习率,在测试的模型族里并没有带来改善;还有,同样的矩阵维度下,GPU 的计算耗时也会随数值变化而不同,所以性能对比必须让输入值和形状都对齐;以及,把通信和计算放到不同 GPU 流上做重叠,并不总能加速,有时反而拖慢端到端执行。
产品链接
- 技术报告:Ai2 Olmo-core 3 Tech Report
- 代码:GitHub · allenai/OLMo-core
- 原文:Hugging Face Blog
趋势洞察
过去一年,“开放”这件事正从模型权重往更深的层面走——先是权重,再是数据,如今轮到了训练基础设施。Olmo-core 3 的意义不只是一份代码:它把万亿参数 MoE 的训练方法、显存优化和失败教训一起摊开,等于给中小研究团队发了一张“入场券”。与此同时,NVIDIA 的 Megatron-Core 仍是训练大 MoE 的主流选择,Olmo-core 3 则给出了一个开放的替代方案。Ai2 也明确表示,下一代 Olmo 将采用 MoE 架构,用上他们最大的数据集和最长上下文。当训练栈本身也成为公共品,模型能力的差距会不会从“谁有钱”转向“谁会调”?这或许才是这份开源最值得玩味的地方。
本文地址:https://www.163264.com/15993