跳到文章正文
行业/好文 编辑推荐

0.2 秒急停、秒级重规划:Aether AI 用「因果」让机器人告别抓瞎

一台机器人正要关微波炉门,人手突然插了进来——它只用了 0.2 秒就紧急悬停。更绝的是,当一只金…

一台机器人正要关微波炉门,人手突然插了进来——它只用了 0.2 秒就紧急悬停。更绝的是,当一只金属易拉罐被混在蛋糕盘里端向微波炉,机械臂会先把易拉罐挑出来放到一旁,确认安全后再送入炉内。这些画面不是提前录好的动作回放,而是系统基于对物理世界因果规律的理解实时推理出来的。驱动它的,是因果智能企业 Aether AI 的 CRIS-0 系统。

一分钟速览

  • UCSD 助理教授黄碧薇创立的 Aether AI 亮出因果智能官方 Demo,系统代号 CRIS-0;
  • 面对突发扰动,机器人平均 2 秒内识别因果变量改变并完成实时重规划,10 次随机扰动 9 次有效恢复;
  • 在 20 条需要隐含推理的模糊指令中,取得 18 次精准抓取与放置;
  • 技术核心是「因果原生 Agent 架构」,把任务本身当作状态进度条。

机器人为什么总是「笨」

长期关注具身智能的人都有体会:很多机器人看起来炫酷,但大部分时候在「背题」。一旦光照变了、东西被踢了一脚、指令稍带隐含意图,立刻抓瞎。传统端到端模型(如 VLA)学得快,但面对长流程任务存在致命弱点——误差累积,第 1 步的小偏差到第 10 步就彻底变形;遇到干扰时它不知道发生了什么,只能硬着头皮按原计划推,或直接崩溃。而常见的 Agent 方案虽会拆解步骤,但思考逻辑停留在文本或概率推理上,环境一变就得先把画面转成文本慢慢琢磨,等你推理完,手可能已经被门夹到了。

把黑盒改造成因果引擎

CRIS-0 的破局思路,是让机器人从「看到什么」走向「理解为什么发生、改变什么会影响结果」。其因果原生 Agent 架构可从三个维度理解:一是「任务即状态」,系统不关心世界表面的像素长什么样,而是关心任务进行到哪一步,任务本身就是一个因果状态进度条;二是用因果变量而非全局坐标来追踪关键信息——比如咖啡机被推开时,系统追踪的是「把手相对位姿」这一关键因果变量,只修正接近和抓取的动作阶段,无需回归原位重启;三是常识推理与物理感知,比如把散落的普通书本整理到茶几、却把涉及隐私的账单收进抽屉,还能通过抓取晃动感知罐内液体状态,判断该扔还是该放回。

数据与趋势

在 Coffee Preparation 抗干扰测试中,CRIS-0 平均 2 秒内完成重规划,10 次随机扰动 9 次有效恢复;在数十步的「客厅寻物与整理」长程任务中,它把目标拆解为原子化、可验证的因果阶段,每步都做前置与后置条件检查。这背后是一个趋势:具身智能的竞争正从「炫酷 Demo」转向「抗干扰的真实可靠性」,而因果推理可能是把机器人从「背题选手」变成「会变通的工人」的关键一步。

本文地址:https://www.163264.com/16590