报告 编辑推荐
AI 自己改代码,评测却太贵:MIT 和 Sakana 用“LLM 当裁判”把成本砍下来
让 AI 自己写代码、自己改进,是“自进化”最诱人的想象。但每一次改进都要重新评测,而评测本身极…
文章目录
让 AI 自己写代码、自己改进,是“自进化”最诱人的想象。但每一次改进都要重新评测,而评测本身极其昂贵——跑一次基准测试可能烧掉大量算力。MIT 与 Sakana AI 的新框架想了个聪明的办法:让一个语言模型来当裁判,把评测成本降下来。
一分钟速览
- MIT 与 Sakana AI 提出 SIFT 框架,用于优化自改进编码智能体的评测。
- 核心思路是用 LLM 作为“裁判”,减少高成本的全量评测。
- 在 Polyglot 基准上取得约 35.1% 的准确率,同时降低算力开销。
- 目标是在“自我改进”的循环中,更快、更省地判断候选方案优劣。
- 这为自进化 Agent 走向实用化提供了评测层的关键拼图。
问题出在哪
自改进编码智能体的工作方式是:提出一个改动,评测它是否更好,留下好的、丢弃差的。问题在于“评测”这一步太贵。用真实测试集全量验证,既慢又烧钱;而如果评测不准,智能体就会朝错误方向进化,越改越差。
所以自进化的瓶颈,表面在“生成”,本质在“评判”。谁能让评判又快又准,谁就能让这个循环真正转起来。
LLM 当裁判的价值
让语言模型去判断两个方案哪个更好,本质上是在用模型的“理解力”替代一部分昂贵的执行测试。它不是要完全取代真实测试,而是做一层高效的筛选:先用低成本手段滤掉明显不好的候选,再把算力花在真正有希望的方案上。这样一来,单位算力能覆盖的候选方案数量就上去了。
在 Polyglot 基准上约 35.1% 的准确率,单看不算惊艳,但它的意义在于“用更少的算力换到接近的效果”。对自进化系统来说,效率本身就是能力。
趋势洞察:评测正在成为新的基础设施
随着模型和 Agent 越来越强,“怎么衡量它们”变成了核心问题。评测做不好,自进化就是盲人摸象;评测做太贵,迭代就寸步难行。SIFT 这类工作说明,行业正在把评测当成一门正经的技术来攻克,而不是附属环节。
可以预见,未来的 AI 竞争不只是模型之战,也是评测体系之战。谁的评测又快又准,谁的迭代就更接近真正的“自我进化”。
本文地址:https://www.163264.com/16111