o1 奠基人泼冷水:1 万个智能体解出世界级难题,多智能体贡献不到 10%
OpenAI 刚在 DevDay 上把多智能体做成了产品,推出了能全天候工作的智能体 Dots …
文章目录
OpenAI 刚在 DevDay 上把多%ignore_a_1%体做成了产品,推出了能全天候工作的智能体 Dots 和面向开发者的 Agents API。就在这个节点上,o1 以及后续推理模型的早期奠基者之一 Noam Brown 泼了一盆冷水:别把功劳都记在多智能体头上。
一分钟速览
- OpenAI 在 DevDay 2026 把多 Agent 推向产品主线,推出 Dots 与 Agents API;
- Noam Brown 表示,用 1 万个智能体解出世界级数学难题,功劳主要不在多智能体,他甚至不会把其中 10% 归给它;
- 真正支撑突破的,是一个足够强的通用模型,以及让它持续运行、并行思考的能力;
- 实测显示,4 个智能体大约能用 2 倍成本换 2 倍速度,16 个效率略低,整体加速低于线性;
- 他设计的机制只给智能体最基础的工具,让它们自行摸索协作方式,甚至自发涌现出层级结构。
深度分析
「多智能体容易获得超额的关注」
在与播客主持人 Dwarkesh Patel 的对话中,Brown 被问到一个极具话题性的问题:1 万个智能体协作,花 88 小时、消耗 1300 亿 token,就能解决千禧年难题?他的回答很克制:功劳并不主要来自多智能体系统,他甚至不会把其中 10% 归给多智能体。之所以能做到,是因为「我们有一个非常强大的通用模型」。
他并不否认多智能体的价值,而是把它定位成一种「并行扩展测试时计算」的方式:模型思考越久表现越好,但思考时间无限拉长会遇到延迟瓶颈,于是让多个智能体并行处理同一件事,牺牲一些效率换取速度。
协作的效率问题,远没解决
大多数 LLM 多智能体系统采用预设编排框架:协调智能体拆解任务、委派给子智能体、子智能体回传结果。Brown 指出其明显局限——子智能体之间通常无法直接通信,即便任务相近、信息互补,也只能各自处理;子智能体若对任务理解不清,要么中断执行提问,要么自行假设并可能偏离目标。
他的路线反其道而行:尽量压低预设结构,只给智能体最基础的工具,核心机制是「智能体可以随时向其他智能体发消息,消息直接进入对方上下文」。事实表明,机制实现得当,会涌现出相当复杂的协作行为,很像人类在 Slack 里协作,甚至自发出现类似「中层管理者」的层级——这些组织方式并非人为设计,而是从大量人类文本中学到的协作知识中内化、再涌现出来的。
规模化之后会发生什么,还没人知道
Brown 坦言,多智能体大规模扩展之后究竟如何,业界还没有完善认识。他们测过单智能体、4 个和 16 个协同:在一些任务上 4 个能把速度提高一倍,16 个也有类似规律但效率略低,总体加速略低于线性,且高度依赖具体任务。要从 4 个推到 1 万个,并确切知道「比 1000 个多带来多少收益」,会非常困难。
数据支撑
- 1 万个智能体、88 小时、1300 亿 token 的协作案例;
- 多智能体贡献被 Noam Brown 判定为不足 10%;
- 4 智能体约 2 倍成本换 2 倍速度,16 智能体效率略降,整体低于线性。
趋势洞察
这条新闻的价值,在于它给火热的多智能体叙事装了一个刹车。厂商乐于把「智能体数量」包装成新的性能指标,但 Brown 的判断提醒我们:底座模型的能力、长时运行与上下文管理,才是决定上限的变量。当越来越多智能体协作更久、承担更多职责,真正棘手的问题不是它们能不能变强,而是我们如何确认——它们在变强的同时,也变得更值得信任。
本文地址:https://www.163264.com/16509