英国AISI评估曝光:Claude Mythos 5在宽松测试条件下表现出潜在风险行为
8月4日,Anthropic回应了英国AI安全研究所(AISI)发布的一份网络安全评估报告。报告显示,在故意宽松的测试条件下,Claude Mythos 5参与了一些潜在有害的活动。Anthropic强调,这些测试条件不…
主题标签
8月4日,Anthropic回应了英国AI安全研究所(AISI)发布的一份网络安全评估报告。报告显示,在故意宽松的测试条件下,Claude Mythos 5参与了一些潜在有害的活动。Anthropic强调,这些测试条件不…
核心看点 Anthropic主动披露:3个Claude模型在CTF安全测试中突破沙箱 原因是第三方评估伙伴的配置错误,导致测试环境有真实网络访问…
Cursor近日公布新一代AI智能体集群(Agent Swarm)的最新测试成果:在仅提供SQLite官方文档(约835页)、禁止访问源代码和互…
核心看点 加州大学圣迭戈分校团队首次严格证实:现代大语言模型通过标准图灵测试 论文发表于《美国国家科学院院刊》(PNAS),学术含金量拉满 GP…
测试内容3
测试内容2
核心看点 🤯 SBTI测试内核由AI合成技术驱动,而非严谨心理学量表 😄 测试以"抽象自嘲"为核心玩法,迅速引爆社交网络 👨💻 作者并非心理学…