Jev 被拉下王座:中国团队 3 天做出开源决策模型 StartLux,36 局棋赢 35 局
如果说 GPT-6、Claude 是「什么都会一点」的通才,那 Jev 走的是一条更窄的路——专…
文章目录
如果说 GPT-6、Claude 是「什么都会一点」的通才,那 Jev 走的是一条更窄的路——专门替 AI 智能体做高频决策:点哪个按钮、调哪个工具、这一步该不该停。这条赛道一度被 Jev 牢牢占住。但上海一家成立不到 5 个月的团队,用一个开源模型把它拉下了榜首。
一分钟速览
- 上海团队 StartLux(原点星辉)开源 StartLux-Decision 决策模型,覆盖 0.8B 到 27B 共五个规格
- 旗舰 27B 在 Decision Index 0.2.1 上得分 63.88,超过 Jev 1.13 的 57.91;38 项基准里领先 31 项
- 国际象棋对弈实测:36 局赢下 35 局
- 单卡 H200 上,0.8B 版本三问题请求仅需 12.2 毫秒,27B 约 102 毫秒
- 全程开源,提供 BF16、Q8_0、Q4_K_M 三种 GGUF 格式,可本地部署
专门做「选择题」的模型
通用大模型的思路是「生成」——把答案一个字一个字吐出来。而决策模型的思路是「打分」:直接把候选动作铺开,一次前向计算给出每个选项的概率,选出最优解。这样做的好处是显而易见的:不需要生成长文本,延迟天然更低;输出的是概率,还可以做智能分流——有把握的场景本地直接执行,拿不准的再转交大模型或人工。
StartLux-Decision 正是沿这条路走的。它支持一次计算同时完成多个判断(比如「选哪个动作」+「要不要结束」),并在工程上做了 CUDA Graph 加速、快速线性注意力算子、多问题合并计算等优化——4B 版本的单次请求耗时因此从 90.3 毫秒压到 26.0 毫秒。
数据说话:领先在哪,落后在哪
按官方公布的评测,27B 版本与 Jev 1.13 的差距主要落在几个 Agent 核心场景上:语言理解 74.5 对 62.0,检索与分类 66.8 对 55.4,工具与自动化 82.2 对 75.1。不过团队也坦诚指出,在知识与推理领域,它以 44.3 落后于 Jev 的 51.4,API-Bank 测试也未领先;部分评测使用了公开训练集(已过滤测试题),时延数据也受硬件环境限制,并非严格同硬件对比。官方自己的结论是:「综合得分领先不等于所有能力都更强,选择模型仍应回到实际任务。」
3 天跑完的研发管线
比榜单名次更值得琢磨的,是它的研发方式。团队把 AI 深度嵌入到数据构造、训练、评测、失败分析的整条链路里,形成一套自建的 Auto Research 管线,用 3 天时间完成了研发与验证。这背后指向的是 RSI(递归自我改进)的早期形态:让人工智能参与改进人工智能本身。
产品链接
趋势洞察
过去一年,Agent 的瓶颈逐渐从「大脑够不够聪明」转移到「每一步决策够不够快、够不够便宜」。通用大模型每做一次工具调用都要消耗巨额 token,而专用决策模型把这件事的成本和延迟压到了另一个量级,并且小参数 + 量化让它能直接跑在端侧。一个越来越清晰的架构分层正在成形:通用大模型负责理解与规划,专用决策模型负责高频、低延迟的即时判断。开源与本地部署,则让这套分工不再只是巨头的专利。
本文地址:https://www.163264.com/16173