跳到文章正文
大模型 编辑推荐

“美版 DeepSeek”首次交卷:Beam 追平 GLM-5.2,Mistral 同步亮牌

西方开放模型阵营正在提速。10 月 5 日至 6 日,被称为“美版 DeepSeek”的美国创业…

西方开放模型阵营正在提速。10 月 5 日至 6 日,被称为“美版 DeepSeek”的美国创业公司 Reflection 发布首款开放权重模型 Beam,法国 Mistral 紧接着推出迄今最大的 Mistral Large 4。耐人寻味的是,两家公司不约而同地把中国模型作为主要比较对象。

一分钟速览

  • Reflection 发布开放权重模型 Beam,总参数 5010 亿,每 token 激活 230 亿;
  • Beam 在部分推理任务上,能以 GLM-5.2 约四分之一到三分之一的算力接近其表现;
  • 但对比中国最新一代模型,Beam 仍有一代左右差距;
  • 中国模型已占 Hugging Face 平台下载量约 41%,开放模型在生产流量中占比升至 56%。

Beam 的成绩单

Beam 是一个 MoE 模型,总参数 5010 亿,每个 token 激活 230 亿参数,面向编程、推理与 Agent 工作负载。它使用 23.8 万亿 token 预训练,Reflection 又动用 1.05 万张英伟达 GB300 连续进行 4 周高算力强化学习,生成超过 1 亿次 rollout。

从官方成绩看,Beam 的最大亮点不是绝对能力,而是推理效率。但在纵向对比中,它的位置也很清楚:在 Agent 编程测试 DeepSWE v1.1 中,Beam 得 44.4 分,几乎与 GLM-5.2 的 44.0 持平,但低于 GLM-5.3 的 61.0 与 DeepSeek V4.1 Flash 的 74.2;在 Terminal Bench v2.1 上,Beam 为 80.1,而几款中国模型均在 88 分以上。Reflection 官方也承认,头部开源模型在绝对能力上仍然领先。

中国模型成了参照系

更值得关注的是产业格局的变化。数据显示,过去一年中国模型已占 Hugging Face 平台模型下载量的约 41%,月度与累计下载量均超过美国。判断开放模型是否“进入生产”,还有一个更硬的指标:在某 AI 网关的生产流量中,开放权重模型处理的 token 占比已从去年底的不足 10%,升至今年 8 月的 56%。

趋势洞察:竞争从“榜单”转向“单位算力的智能”

Reflection 把 Beam 的卖点定位为“单位推理算力能换来多少智能”,这其实是一种更务实的叙事——企业要的不是榜单第一,而是可长期运行、成本可预期的主力模型。当开放模型的能力差距被压缩到“一代以内”,价格、效率与部署自由度,就会成为真正决定胜负的变量。

本文地址:https://www.163264.com/16453