大模型 编辑推荐
“数学只是开胃菜”:OpenAI 推理之父谈多智能体时代
一道千禧年难题被解开了,但当事人给出的评价却很克制:一万个 Agent 加起来,最多只占了十分之…
文章目录
一道千禧年难题被解开了,但当事人给出的评价却很克制:一万个 Agent 加起来,最多只占了十分之一的功劳。
一分钟速览
- OpenAI 研究员、o1 核心作者 Noam Brown 在最新播客中系统谈论多智能体系统。
- 他透露:OpenAI 曾动用 1 万个 AI Agent,耗时 88 小时、消耗 1300 亿 token,攻克一道千禧年数学难题。
- 但 Brown 判断,Agent 在这一成果中最多只贡献了 10% 的功劳,人也一样。
- 他的核心框架仍是 test-time compute scaling:思考时间越长,表现越好。
- 访谈还涉及递归自我改进(RSI)、超级对齐,以及“模型强到一秒解题后如何继续提升”等问题。
深度分析:从“想更久”到“一起想”
2023 年,几乎所有人还在卷模型参数时,Brown 已经开始押注推理时计算。一年后 o1 问世,“深度思考”成了标配。现在他把注意力转向多智能体:单模型想得再久,也有上限;让多个 Agent 分工、互查、并跑,才可能突破这个上限。
他用的类比很朴素:SAT 考试只给五分钟,成绩必然糟糕;给五小时,成绩就好得多。模型也一样,用更长的“自言自语”去理清问题、审视情形、排除错误路径。多智能体只是把这条曲线再往上抬了一层。
数据支撑:1 万个 Agent、88 小时、1300 亿 token
这三个数字勾勒出当前多智能体方法的真实成本:规模巨大、耗时近四天、token 消耗以千亿计。Brown 的“10% 功劳论”既是谦逊,也是在提示——真正的突破来自问题定义、验证机制与技术积累,而不只是把 Agent 堆得更多。
趋势洞察:当发布周期短于任务周期
访谈中一个值得警惕的问题被提了出来:如果前沿模型能连续执行长达三个月的任务,而模型的发布周期只有两个月,怎么办?这不仅是工程问题,更是治理问题——如何监测模型的思维链、如何确认对齐已经解决、如何在能力跃升的同时保持可控。
结语
Brown 的判断可以浓缩成一句:数学这类“有标准答案”的任务,只是多智能体时代的开胃菜,真正的主菜是开放世界里的协作与验证。
本文地址:https://www.163264.com/15885