跳到文章正文
anthropic-Claude 编辑推荐

Anthropic 报告点名 GLM-5.3:从“你抄我”到“你太强”

不到三周,Anthropic 又一次点名了智谱。上一次的话题是“蒸馏”,这一次变成了“网络安全”…

不到三周,Anthropic 又一次点名了智谱。上一次的话题是“蒸馏”,这一次变成了“网络安全”——措辞也从“你抄我”悄悄换成了“你太强”。

一分钟速览

  • Anthropic 威胁情报报告点名智谱 GLM-5.3,称其可能让攻击者在“几乎没有限制”的情况下获得漏洞发现与利用能力。
  • 报告称 GLM-5.3 缺乏实质防护,可通过 abliteration 拆掉护栏。
  • 但报告自身数据显示,原版 GLM-5.3 在三个有害请求基准上的平均拒答率约 95%,与 Claude 的约 96% 相差无几。
  • 智谱在 8 月发布时已把权重推迟两周开源,声称先完成安全评估与加固,最敏感能力仅通过受信访问计划开放给验证过的用户。
  • Anthropic 的两条建议:尽快把前沿模型开放给更多防御者;对足够强的模型开展独立安全测试。

深度分析:一份报告里的三个疑点

第一,把“拆护栏”当成 GLM-5.3 的独有问题是站不住的。abliteration 针对的是“开放权重”这个属性,任何开源模型都可能被这样处理。第二,Claude 之所以“骗不动、拆不了”,很大程度上源于权重不公开、API 不允许预填思考——这更像产品形态的差别,而非安全设计的胜负。第三,智谱在发布时已采取延迟开源与受信访问的做法,思路与 Anthropic 对自家 Mythos 5.1 的处理方式相近。

数据支撑:95% 与 96%

原版 GLM-5.3 平均拒答率约 95%,Claude 约 96%——这个差距在统计意义上几乎可以忽略。报告想要论证“危险的独特性”,但自有数据反而指向了相反的结论。

趋势洞察:安全话语正在成为竞争工具

当模型能力趋同,安全叙事就变成了差异化手段。9 月 10 日点名七家中国实验室“蒸馏”,9 月 30 日又聚焦模型能力本身——从“你不够原创”到“你太危险”,这类转变值得放在商业竞争语境里看。对中国开源团队而言,更现实的启示是:把安全评估流程、受信访问机制和可验证的拒答数据公开出来,比争论更有效。

结语

安全讨论本身没有错,问题是它不应该只在下一次点名时出现。

本文地址:https://www.163264.com/15883