联想天禧 TianxiCode 登顶 SWE-bench-Live 全球第一:71% 问题解决率通过官方 Verified 认证
在软件工程圈,一个代码智能体到底有没有「真本事」,靠的是让它去修真实 GitHub 项目里的真实…
文章目录
在软件工程圈,一个代码智能体到底有没有「真本事」,靠的是让它去修真实 GitHub 项目里的真实 Bug,而不是背几道语法题。在国际公认难度最高、最贴近真实开发环境的评测 SWE-bench-Live 上,联想天禧 AI 自研的代码智能体框架 TianxiCode 配合 DeepSeek-v4.1-Flash,以 71% 的问题解决率登顶全球第一,并正式通过官方「Verified」审核。
一分钟速览
- 联想天禧自研代码智能体框架 TianxiCode 在 SWE-bench-Live(Lite 分榜)登顶全球第一;
- 配合 DeepSeek-v4.1-Flash,取得 71% 问题解决率,并通过官方 Verified 核验;
- 具备跨文件多跳检索、自驱动规划、闭环补丁生成三大系统工程能力;
- 未来将落地联想 AI 硬件产品,服务真实开发场景。
SWE-bench-Live 的含金量
与传统考查语法或单函数生成的测试不同,SWE-bench-Live 以真实 GitHub 项目的问题为基础,评估智能体生成代码补丁、修复问题的能力,并提供可复现的执行环境。官方还设立了「Verified」核验机制:参评方案必须提交全链路智能体运行轨迹,由官方团队严格审查评测输入、信息隔离环境,并彻底排查是否存在向智能体泄露标准答案或测试用例的可能。TianxiCode 能通过这项审查,说明其成绩可复现、有含金量。
「大脑」与「工具箱」的配合
如果把整套系统比作一个软件工程师,DeepSeek-v4.1-Flash 是负责阅读代码、理解语义、构思解法的「大脑」,TianxiCode 则是眼、手、工具箱和工作流规范。官方披露,多项榜单对比印证了一点:若缺乏顶层智能体架构的系统协同,即便调用顶级闭源模型,面对真实工程难题也常常束手无策。
TianxiCode 的三大工程能力值得拆开看:跨文件多跳检索与精准上下文管理,让它在大型代码库中「顺藤摸瓜」定位缺陷根因;自驱动规划与多轮工具调用,让它像真人程序员一样主动打开终端跑测试、翻日志、比对修改记录;闭环补丁生成与测试驱动自愈,则让它能在隔离环境中自测自纠,直到补丁通过项目验收。
趋势洞察
榜单排名的意义,最终要落到「帮一线开发者分担排错与工程协同成本」上。联想天禧 AI 表示将持续把 TianxiCode 的技术成果向开发者工具链沉淀,并深度赋能联想硬件设备。这背后是一个更宏观的趋势:代码智能体的竞争力,正从「单点模型分数」转向「模型 + 工程架构」的系统性能力,谁能把模型潜力通过工程底座释放出来,谁才能在真实研发场景里站稳脚跟。
为什么这套组合能赢
值得注意的还有 TianxiCode 的选型思路:它没有一味追求更大参数的闭源旗舰模型,而是把 DeepSeek-v4.1-Flash 作为「大脑」,再通过自研工程底座把模型潜力充分释放出来。这印证了一个行业共识——在真实的软件工程任务里,模型能力与智能体架构是相乘而非相加的关系:一个优秀的工程框架,往往比单纯换更大的模型更能决定最终的问题解决率。对开发者而言,这也意味着代码智能体的竞争,正在从「比谁的模型更大」转向「比谁的工程底座更扎实」。
本文地址:https://www.163264.com/16588