跳到文章正文
openai-gpt 编辑推荐

OpenAI 安全团队再地震:透明度负责人离职,三名研究员因泄密被开

当你打开一个新模型的发布页,最先看到的往往不是跑分,而是一份几十页的 system card——…

当你打开一个新模型的发布页,最先看到的往往不是跑分,而是一份几十页的 system card——它告诉外界,这个模型有没有可能被用来制造生物或网络攻击,公司又做了哪些防护。很少有人知道,长期负责把这些复杂的安全判断“翻译”给公众的人,刚刚离开了 OpenAI。

据多家媒体报道,OpenAI Safety Systems 团队内负责“安全透明度”职能的负责人 David Robinson 已经离职。他本人没有公开说明原因,OpenAI 也没有公布继任者。更早之前,公司还开除了三名安全与对齐方向的研究员——Jasmine Wang、Tomek Korbak 和 Mikita Balesni,理由是内部调查发现三人把公司敏感信息分享给了一家外部 AI 安全机构,其中甚至涉及 OpenAI 的基础设施架构。

一分钟速览

  • OpenAI“安全透明度”负责人 David Robinson 离职,继任者未定
  • 三名安全/对齐研究员被开除,被指把敏感信息外泄给外部安全机构
  • Robinson 主导撰写了 OpenAI《Preparedness Framework 2.0》
  • 安全透明度团队负责产出 system card,被称为模型风险的“营养成分表”
  • OpenAI 安全线近年高管与骨干持续流失,“地震”并非第一次

一个不耀眼、但很关键的岗位

用 Robinson 自己的话说,他的工作是帮助外界理解并信任 OpenAI 在系统安全上所做的技术工作,扮演技术部门与公众之间的“翻译器”。Safety Systems 团队负责模型的评估、红队测试、安全措施和部署决策,而这些过程和结论往往极其复杂,外界很难仅凭一组测试数据就判断模型安不安全。

安全透明度团队要做的,就是把内部的技术发现、风险判断和部署决定,整理成外界看得懂的公开材料,产出包括 system card、Deployment Safety Hub、安全研究博客以及公开治理文件。其中最常见的就是 system card:一款模型用了什么训练方法、接受了哪些安全评估、在生物和网络攻击等高风险领域达到什么能力、内部采取了什么措施、措施之后还剩什么风险,都要写清楚。它就像食品包装上的营养成分表——看的人不多,但必须得有。

他留下的那套“风险尺子”

Robinson 还是 OpenAI《Preparedness Framework 2.0》的主要起草人。这套框架用于追踪前沿模型可能带来的严重风险,并提前规定模型达到某种能力后,公司需要做哪些评估、加哪些防护。第二版框架新增了三类需追踪的能力:生物与化学能力、网络安全能力,以及 AI 自我改进能力。如果追踪中发现模型能力达到 High,就意味着它可能显著放大现有的严重危害路径,必须在部署前配置足够的安全措施;一旦达到 Critical,则代表模型可能凭空创造严重危害路径,是否继续开发都将存疑。

一个被反复引用的例子是 Deep Research。在其 System Card 中,这款模型的生物学评估显示它正“接近”High 能力门槛——换句话说,它开始接近能够实质帮助非专业人士制造已知生物威胁的水平。如何准确地向公众描述这种安全领域的“阈限空间”,正是 Robinson 的职责。

为什么这件事值得关注

Robinson 离职消息曝光前,OpenAI 的安全部门就已状况频发。被开除的三人主要从事安全与模型对齐研究,其中 Tomek Korbak 此前还担任 OpenAI 与第三方评估机构 METR、Redwood Research 之间的技术联系人——这两家机构正是此前相关事件后 OpenAI 邀请进驻调查的第三方。第三方评估与安全透明,本该是 OpenAI 对外重建信任的两根支柱,如今一根的人走了,另一根的人被开除,信号并不轻松。

事实上,从 Dario Amodei 时期起,OpenAI 的安全团队就一贯变动频繁:此前有“灾难风险应急”团队被解散、GPU 大神 Scott Gray 出走,也出现过“一个月跑掉四名高管、安全线几乎被一锅端”的局面。

离职之前,Robinson 曾在 X 上多次公开谈论高能力 AI 带来的风险。9 月初他说,OpenAI 内部的人正在逐渐意识到高能力 AI 模型可能产生的影响,“OpenAI 的确每天都在发生重大变化,但我不知道这种变化是否足够快”。在最新一则帖子中,他转发并百分百赞同另一位研究人员的观点:竞相发展 RSI(递归自我改进)未必是囚徒困境,它可能就像普通人直觉看到的那样,既疯狂又傲慢。

趋势洞察

对一家正在冲刺前沿模型的实验室来说,安全透明度不是一个“公关岗位”,而是把内部风险判断转化为外部可核验信息的制度接口。负责人离职、骨干被以“泄密”名义开除,短期内未必影响模型上线,却会侵蚀外界对 system card 与安全承诺的信任度。当行业把注意力都放在参数、跑分和发布节奏上时,谁在认真维护这套“风险说明书”,正在成为比性能更值得追问的问题。

本文地址:https://www.163264.com/16153