让 Agent“看菜下饭”:openJiuwen 首发 X-Router,实测 Token 消耗减少 50%+
先做一个思想实验:你让 AI 助手把一个简单句子翻译成英文,它调用的是参数量千亿、跑在云端最贵算…
文章目录
先做一个思想实验:你让 AI 助手把一个简单句子翻译成英文,它调用的是参数量千亿、跑在云端最贵算力上的模型;你让它写五十行代码、再自己 debug 三轮,它调用的还是同一个模型。这是今天绝大多数 AI 应用的真实状态——一个模型包打天下。而 openJiuwen 团队给出的答案,是给 Agent 配一位“调度员”。
一分钟速览
- openJiuwen 团队首发自演进模型路由技术 X-Router,专为 Agent 解决“该用哪个模型”。
- 核心目标:基于任务复杂度动态决策与编排,实现成本—效果综合最优。
- 三层能力:看得准(精准画像)、选得对(决策)、越用越好(演进)。
- 决策时引入 KV 缓存亲和、实时负载、目标可用性等系统状态。
- 昇腾亲和,实测 Token 消耗减少 50% 以上。
问题不在“贵”,而在“忘了路由”
不是所有任务都需要最强的模型。真实场景里,一个 Agent 往往同时握着本地模型、云端模型,以及来自不同厂商的多种服务。当可选模型越来越多,麻烦随之出现:简单任务用昂贵模型造成浪费;复杂任务交给轻量模型效果不稳;依赖固定规则选择,又跟不上业务与模型的持续变化。
用户真正需要的,不是一张需要反复维护的模型路由表,而是让 Agent 自己判断:这次请求该由谁处理、为什么这样选、下一次能否更好。openJiuwen 由华为 2012 实验室、华为云、终端、计算、算力先遣队等团队联合高校与企业共同构建,是一个开源 AI Agent 平台。它给出的方案,是在 Agent 与模型之间加一层面向请求的智能决策能力——一个专门负责“这一轮该用哪个模型、用什么策略”的路由引擎。
三层能力,构成一套路由体系
第一层是精准画像。模型能力不是静态标签,“代码能力强”还不够,得知道强到什么程度、在什么题型上强、换个领域还强不强。openJiuwen 基于历史数据离线刻画每个模型的能力画像,并在模型版本变动或表现变化时在线动态刷新,更新时延优于 1 分钟。有了画像,路由才有可靠起点,同时做到“决策与执行分离”——路由层只管判断,具体调用交给宿主。
第二层是决策。Agent 任务是多人轮、有状态的,复杂度判断不能只看当前这句话,要看整条轨迹:走到哪了、接下来要做什么、前面失败过什么。团队把最近的对话窗口连同工具调用进展一起送进判断,并特意保留了“最近一次用户诉求”,确保调度员始终知道雇主想要什么。更关键的是引入系统状态:KV 缓存亲和(与哪个模型上已有缓存更“熟”,同模型缓存命中与否成本可差出一截)、实时负载(谁更空闲、响应更快)、目标可用性等。这些是纯算法视角容易漏掉、却对真实收益影响最大的一块。
第三层是演进。每一次决策的结果都会变成经验,让下一次判断更准。团队强调这套系统要同时具备三个属性:可配置(业务能带入自己的偏好,这一轮要最省还是最快自己说了算)、可演进(模型生态流动,新模型、降价、版本迭代都要能跟上)、可观测(每次决策依据与执行反馈都要能回溯,说不清“为什么选它”的路由器没人敢放进生产)。
趋势洞察:从“最强模型”到“最优组合”
X-Router 的价值,不只是一个省 Token 的技巧,而是对 Agent 架构的一次提醒:当模型越来越多、越来越便宜,系统真正的竞争力,正从“拥有最强的那个模型”,转向“把合适的任务交给合适的模型”。
这与同一天 MiniMax M3.1 Flash 展现出的“轻量模型逼近旗舰”形成呼应——能力上限在上移,单位成本在下探,而把两者连接起来的那层调度能力,或许才是 Agent 时代最稀缺的部分。openJiuwen 称,这套方案与昇腾亲和,实测可将 Token 消耗减少 50% 以上。
参考来源:量子位对 openJiuwen X-Router 的报道。
本文地址:https://www.163264.com/16058