Anthropic三大重磅更新:AI自动对齐、科学家免费计划、硬件安全标准

核心看点

  • AI自动对齐突破Claude仅用48小时+1块GPU,自主修复10种AI对齐失败问题
  • 科学家福利:1万个免费Claude Team席位,学术机构PI可申请
  • 硬件安全新标准:Model Hardware Standard (MHS) 研究预览发布,AI控制物理设备有了统一规范

一、AI自动对齐:让AI自己修复自己的安全问题

8月28日,Anthropic发布了一项重磅研究——自动化对齐研究者(Automated Alignment Researchers)。

简单来说,他们让Claude在只有48小时和1块GPU的条件下,自主研究、提出方法、训练模型并测试改进效果。结果令人震惊:

  • 成功修复了10种对齐失败问题,包括欺骗(deception)、谄媚(sycophancy)等
  • 在修复安全问题的同时,保持了模型原有能力不下降
  • 方法泛化性极强:适用于未见过的新基准测试、Petri行为审计,以及比原模型大4.7倍的模型
  • 最惊人的测试:Sonnet 5对一个早期版本的Opus 4.8进行后训练,安全分数接近最终量产版本

这意味着什么?AI可能具备了自我改进安全性的能力。Anthropic已经开源了这套自动化对齐研究框架,供其他研究者使用。

二、Claude科学家计划:学术研究免费使用

8月27日,Anthropic推出了Claude Team科学家计划,面向学术和非营利机构:

  • 标准席位:完全免费
  • 高级席位(5倍使用量):每月仅15美元(首年8折优惠)
  • 覆盖领域:数学、化学、物理、蛋白质设计等
  • 名额:首批10,000个席位,由机构PI(首席研究员)申请

这是Claude Science(6月推出)和AI for Science计划的延伸。对于做科研的老板们来说,这是个不容错过的福利。

三、Model Hardware Standard:AI控制物理设备的安全标准

同一天,Anthropic还发布了模型硬件标准(MHS)的研究预览:

  • 目标:为AI模型安全控制实验室、制造设备、机器人、电子设备等物理硬件建立统一接口
  • 目前最强支持:实验室/制造设备
  • 扩展中:电路板、摄像头等更多设备类型
  • 与HHMI等科学机构合作

这是AI从数字世界走向物理世界的关键一步。Anthropic邀请科学、机器人、电子和制造领域的利益相关者加入预览,共同塑造这一标准。

总结

短短两天,Anthropic连发三大更新:

  1. 技术层面:AI自动对齐研究让模型能自我改进安全性
  2. 应用层面:科学家免费计划降低学术研究门槛
  3. 安全层面:MHS标准为AI进入物理世界铺路

这三件事指向同一个方向:Anthropic正在构建一个更安全、更开放、更实用的AI生态系统。对于关注AI发展的老板们来说,值得持续关注。

发布时间:2026年8月30日 | 信息来源:Anthropic官方X账号

本文地址:https://www.163264.com/15339

(0)
上一篇 14小时前
AI日报:腾讯开源770B参数Hy4preview模型;Midjourney V8.2上线图像编辑功能;谷歌Gemini Omni 1.1 Flash登场
下一篇 10小时前

相关推荐