跳到文章正文
行业/好文 编辑推荐

估值 100 亿美元的 Jev:创始人说“给我十亿美元也不从头预训练”

最近爆火的不是又一个大模型,而是一个“不会聊天、只会做决定”的模型——Jev。它的联合创始人兼 …

估值 100 亿美元的 Jev:创始人说“给我十亿美元也不从头预训练”

最近爆火的不是又一个大模型,而是一个“不会聊天、只会做决定”的模型——Jev。它的联合创始人兼 CEO、TypeSafe AI 的 Diogo Almeida 在一期访谈里几乎把行业底裤都掀了:公开榜单极容易被操纵,可靠性才是产品的灵魂,而预训练实在太烧钱,给他十亿美元也不会选择从零开始。

一分钟速览

  • Jev 发布视频浏览量 6 天突破 3870 万,JevBench 综合榜以 75.3 分排名第一
  • Diogo Almeida:公开 benchmark 极易被操纵,更相信针对具体工作流的评估
  • 公司日处理量已突破一万亿 token,夜间流量仍在走高
  • 他判断 AI 编码目前仍是围绕单一模型的竞争,各家开源 coding agent 差距不大
  • “就算给我十亿美元,我也不会选择从头预训练大模型”

榜单可以被牵着走,可靠性才是灵魂

Diogo 坦言,公开 benchmark 极其容易被操纵,即便开发者没有主动作弊,最终也可能被榜单牵着走。所以相比一张通用榜单,他更愿意相信长期积累的产品体验与信任:直到你把模型放进自己的工作流,并针对那个工作流去评估、去测量,才能判断它在真正重要的流程里表现如何。他还抛出了一个被广泛引用的问题:“AI 已经聪明到足以挑战千禧年大奖难题,为什么还是没法自动化大量最基础的工作?”

在他看来,这些基础工作门槛不高、也没什么职业成就感,人类本可以做更有意思的事,却仍被困在重复枯燥的任务里,根本原因是还没法把它们自动化——手里有一台动力强悍的自动化引擎,却找不到接口接进真正有商业价值的业务场景。他反复强调,整个行业都在卷速度、拼成本,反倒把可靠性弄丢了;而可靠性才是一款产品真正的灵魂,也是大家敢于托付信任的关键。推理类大模型确实够聪明,但可靠性仍有很大短板,因为模型的优化目标不一样。

一万亿 token 之后,真正的瓶颈是“额度”

Diogo 分享了一组数据:公司日处理量已经突破一万亿 token,而且不是昙花一现的峰值,夜间流量也在持续走高,说明大量调用来自机器自动化,而不只是普通用户尝鲜。相比注册量,他更看重重度开发者——推特上有人调侃他们是“营销天才”,但团队几乎没有市场预算,所谓营销只是直白地持续向候补名单开放注册。他承认这里踩过坑:很多注册用户根本不是开发者,跑几条查询后疑惑“它又不是聊天机器人”就走了;而一个重度开发者写一段循环批量调用,创造的价值远大于这些注册用户。

真正棘手的是调用速率限制(rate-limit)。一旦用户从模型里拿到业务价值,就会需要更大的调用配额。软件系统本就该这样搭起来:前期投入成本搭建链路,当链路产出的价值超过搭建成本,就可以把它放到后台持续运行,作为其他系统的依赖,再在上面搭更高层应用,创造海量现实价值。

行业正在从“镜子屋”里走出来

Diogo 形容过去几年的 AI 行业像游乐园里的镜子屋,大家有点脱离现实,说着逻辑对不上的话;而就在这周,行业终于被拉回现实——人们开始意识到 AI 比之前想象得强大得多,由 AI 驱动经济变革也再次成为认真讨论的议题。他给自己定下的标尺是拉动 TFP(全要素生产率)增长,目标是在五年内拉动 3%。他还说,自己已经厌倦 AI 永远站在舞台中央,“世界本身就应该更有趣,AI 只需要退到幕后,默默提供辅助”。

对当下最热的编码赛道,他的判断也颇为冷静:目前的 AI 编码本质上仍是围绕单一模型展开的竞争,只是提供不同档位供用户选择,各家开源 coding agent 的能力差距并不大,while 循环能实现的能力边界是有限的。但一旦某家做出独有的杀手级场景,所有人都会蜂拥而至,而开源项目可以快速复刻这套能力。

趋势洞察

Jev 的走红和 Diogo 的表态,指向同一个趋势:模型竞赛正从“谁的通用分更高”转向“谁在真实工作流里更可靠、更便宜、更可集成”。当一位创始人公开说“不从头预训练”时,意味着后训练、路由、可靠性工程和推理经济性,正在成为新一波竞争的主战场。

本文地址:https://www.163264.com/16157