前 OpenAI 研究员:Codex 和 Claude Code 都跑偏了,Jev 要用 RLCD 让 AI 成为「软件里的数据库」
「在我看来,Jev 出现之前的 AI 世界,简直是个悲剧。」TypeSafe CEO、Jev 创…
文章目录
「在我看来,Jev 出现之前的 AI 世界,简直是个悲剧。」TypeSafe CEO、Jev 创始人 Diogo Almeida 在 Latent Space 播客里说得相当直接。这位曾参与 OpenAI InstructGPT 工作的研究者认为,AI 明明聪明到能解数学界千禧年难题,却连最基础的自动化工作都无法落地——问题不在智能上限,而在「把智能接进业务流程」的接口仍然欠缺。
一分钟速览
- Jev 提出面向校准决策的强化学习(RLCD)框架,让模型输出可供代码直接消费的选择、评分与概率;
- Diogo Almeida 认为 Claude Code 与 Codex 仍属同一阶段——AI 主要围绕人提供辅助,尚未成为可编程的软件能力;
- RLCD 与 RLHF 的核心区别:前者让模型成为软件可靠调用的能力,后者让模型「说用户想听的话」;
- RLHF 存在「模式坍缩」缺陷,掩盖长文本错误累积,也解释了文本模型为何不擅长决策。
AI 自动化的真正瓶颈
Diogo 的核心判断是:AI 自动化的瓶颈不在智能上限,而在输出不可信、不可编程。RLHF 训练出的模型倾向于「模式坍缩」——偏向生成更安全、更常见的答案,牺牲概率分布的真实校准。这既掩盖了长文本中的错误累积,也解释了为什么擅长聊天的文本模型一碰到决策就掉链子。要让 AI 真正进入工程化流程,就必须先解决「输出可信、可编程」这个接口断层。
RLCD:让代码直接消费智能
Jev 给出的答案,是面向校准决策的强化学习(RLCD)。它的优化目标不是让模型「遵循指令、获得认可」,而是让模型成为软件能够可靠调用的能力:通过概率化决策输出实现不确定性量化,开发者可以依据置信阈值自主编排人机协作流程——何时交给 AI 执行、何时转交人工,都由代码控制。Diogo 把 Jev 定位为「System One 模型」,希望智能像数据库、正则表达式一样,成为开发者随手调用的普通能力,甚至让用户意识不到它的存在。
关于可靠性,Diogo 的表述也很务实:他更看重「稳健性」——问题含义没变,就不该因为加入无关字符而大幅改变判断;已部署的模型不会悄悄修改,因为 API 是别人程序里的依赖,但会快速发布新版本。他也不反对评测,反对的是「围绕榜单优化,让分数脱离真实价值」。
趋势洞察
这场访谈指向一个正在发生的转向:AI 工程化的下一站,不是把模型做得「更会聊天」,而是把「决策」变成一种可被代码消费、可量化不确定性的基础能力。当智能真正退到软件背景中,AI 才会从「需要人守在旁边反复检查的助手」,变成业务系统里值得托付判断的一环。
四个落地方向
Diogo 为 Jev 梳理了四类企业应用方向:一是分析因处理成本太高而被闲置的「暗数据」;二是为实时流程提供快速判断;三是检查其他模型的调用和输出,充当「裁判」角色;四是把智能判断直接嵌入软件核心逻辑。他尤其看好暗数据分析和编程 Agent,但强调具体如何组合模型,仍要看它能否降低成本、解决原本解决不了的问题。这种务实态度,与他一贯反对「刷榜」的立场一脉相承——开发者最终要把模型放进自己的工作流,测量实际表现,而不是只看价格、速度或一个总分。
本文地址:https://www.163264.com/16598