对齐

  • Claude能自己教自己安全了!Anthropic发布自动化对齐研究重大突破

    核心看点 Claude自主完成AI安全研究:在48小时内,Claude独立搜索文献、提出方法、训练并测试模型,成功修复10类AI对齐失败问题 超越人类研究员:在欺骗行为检测上,Claude的方法比6位经验丰富的安全研究员好20% 已验证可扩展:方法在比原模型大4.7倍的模型上依然有效,且能修复生产级模型Claude Opus 4.8的安全漏洞 开源研究框架:Anthropic已…

    anthropic-Claude 15小时前