Cursor新一代AI智能体集群完成SQLite重建测试,全部配置实现100%通过率

Cursor新一代AI智能体集群完成SQLite重建测试,全部配置实现100%通过率

Cursor近日公布新一代AI智能体集群(Agent Swarm)的最新测试成果:在仅提供SQLite官方文档(约835页)、禁止访问源代码和互联网的严格条件下,集群成功用Rust从头重建了SQLite数据库引擎,并最终在所有模型配置下均达到100%测试通过率。这一结果标志着多智能体协作编程在复杂、长周期任务上的重大突破。

严格条件下的重建挑战

测试要求智能体集群仅依据官方规范实现完整功能,不参考任何现有代码,也不联网搜索。最终产出的Rust版本在独立的held-out测试套件(包括大量SQL查询与正确结果验证)上全部通过。早期运行在4小时节点时通过率约73%–85%,继续运行后均达到满分。相比旧架构,新集群生成的代码更精简(例如部分配置从数万行降至约1万行以内),合并冲突也大幅减少(从数万次降至不足千次)。

“规划智能体 + 执行智能体”新架构

新一代集群采用明确的分工模式:

  • 规划智能体(Planner):运行在前沿高性能模型上,负责任务分解、架构决策与子任务分配,形成树状工作结构。
  • 执行智能体(Worker/Execution):使用成本更低、速度更快的模型,专注具体代码实现。

这种分工有效减轻了单个智能体的上下文负担,避免“既要全局规划又要细节编码”的冲突,显著提升协作效率并减少代码重复与冲突。Cursor还为此构建了自定义版本控制系统(以应对每秒近千次提交的速率),以及共享“Field Guide”知识库,帮助智能体跨运行积累经验。

测试还揭示了显著的经济差异:全部使用前沿模型的成本可高达约1万美元,而“前沿规划 + 廉价执行”的混合配置成本可低至约1339美元,质量相当,成本差距达15倍。

Cursor 3:从研究到核心产品

随着Cursor 3的发布,智能体集群已从内部研究项目升级为核心产品能力。开发者可在统一界面并行运行多个AI智能体,协作完成复杂开发任务。新架构不仅验证了多智能体在长周期软件构建中的可行性,也为大规模AI协同编程提供了可落地的实践路径。

这一成果表明,通过合理的分工与协调机制,AI智能体集群已能在高度约束条件下复现复杂系统级软件。未来,类似方法有望进一步降低复杂软件的开发门槛与成本,推动“从规范到可运行代码”的自动化进程。

本文地址:https://www.163264.com/14295

(0)
上一篇 11小时前
下一篇 11小时前

相关推荐