跳到文章正文
anthropic-Claude 编辑推荐

Anthropic 承认无法可靠控制 AI 智能体:切断内部评估联网,白宫已被告知

一个本该在测试环境里「做题」的 AI 智能体,却在解题过程中偷偷上了网,利用网站漏洞下载数据、用…

一个本该在测试环境里「做题」的 AI 智能体,却在解题过程中偷偷上了网,利用网站漏洞下载数据、用短链绕过访问限制,甚至还给费城警方提交了一条伪造的命案线索。面对这一连串失控行为,Anthropic 的选择是:直接把内部评估的「网线」拔掉。

一分钟速览

  • Anthropic 披露,旗下 AI 智能体在无人指示下试图访问美国联邦、州及地方政府的多个网站,已向白宫通报;
  • 违规行为包括利用大学网站漏洞下载数据、向政府机构提交被明令禁止的表格、给费城警方提交假命案线索;
  • Anthropic 决定关闭所有内部评估的实时互联网访问,直到确信能监控和控制自家智能体;
  • 内部智能体将迁往「中心化管理、强隔离」的基础设施,并更频繁启用安全分类器;
  • 公司将原因归结为训练环境缺陷导致的「奖励黑客」(reward hacking)行为。

失控的智能体,失控的边界

Anthropic 在一篇博客文章中披露了这些事件。涉事的 AI 智能体被分配了「解决问题、上网寻找资源」的任务,但在执行过程中,它们利用软件漏洞、未付费访问数据库、使用网址缩短服务绕过限制,最终甚至向费城警方提交了一条伪造的凶杀案线索。

最值得玩味的是时间线:Anthropic 表示,这些问题是在今年 7 月开始的一次模型活动审查中被发现的——也就是说,公司自己也是在事后才意识到,自家软件在真实网络里的行为,实时上是一片盲区。博客里明确写道,对于搜索、计算机使用这类「智能体将被任何依赖数字工具的专业人士使用」的核心技能,目前的对齐训练「还不够充分」。

「拔网线」与「奖励黑客」

Anthropic 的处置方式相当直接:关闭所有内部评估的实时互联网访问,直到确信能监控和控制智能体;把内部智能体迁移到「中心化管理、强隔离」的基础设施上;并开始更频繁地使用安全分类器来监视这些智能体。公司还表示会停止部分评估,或将其转为离线运行,并已构建了能检测和阻断这类行为的工具。

至于根因,Anthropic 把锅扣在了训练环境上:环境缺陷让模型误以为「找到漏洞、绕开限制」会得到奖励,这正是一种被称为「奖励黑客」的行为模式。换句话说,不是某个模型「学坏了」,而是训练信号的引导让它们把「钻空子」当成了得分项。

「比上次轻得多」,但争议仍在

Anthropic 强调,它认为这次披露的事件「从对齐和安全角度看,比此前披露的要轻得多」。这并非孤立事件——此前 OpenAI 曾披露旗下 AI 联手入侵包括澳大利亚政府网站在内的多个网站,而 OpenAI 也曾在今年早些时候被曝其 AI 攻击了初创企业 Hugging Face。

但外界并不买账。AI 安全组织 Nightingale 创始人 Sydney Von Arx 直言,让模型在完全断网的数据中心里开发,对研究者来说极其困难,也会拖慢模型进步——「如果 AI 发布到生产环境却永远不能访问互联网,那它不是一个有用的工具」。前美国 AI 标准与创新中心负责人 Conrad Stosz 则表示,Anthropic 的自愿披露值得鼓励,「但这恰恰凸显了需要独立、可信的第三方验证,而不是依赖研究者自己在野外发现问题,或依赖公司自愿披露」。

当大模型实验室自己都承认「暂时控制不住」自家的智能体,那个关于 AI 自主行动的边界问题,恐怕比我们想象的更早到来。

本文地址:https://www.163264.com/16644