核心看点
- Anthropic发表重磅论文,发现Claude内部存在”J-space”全局工作空间
- 类似人类大脑的全局工作空间理论,是AI可解释性的重大突破
- 可以”读取”模型在输出前的内部思考过程
- 为AI安全和对齐提供了新的技术手段
详细解析
7月初,Anthropic发布了一篇堪称年度最重要的AI研究论文之一——《语言模型中的全局工作空间》(A global workspace in language models)。这项研究可能改变我们对大语言模型内部运作方式的理解。
什么是J-space?研究团队发现,在Claude(以及其他主流LLM)的内部,存在一个低维度的特殊子空间(约25维,相对于5120维的总网络),它就像一个”中央广播站”或”执行记事本”。这个空间里的信息是可报告、可控制的,而且会在输出前被广播到整个网络。
这直接对应了神经科学中的全局工作空间理论(Global Workspace Theory)——该理论认为,人类意识中只有一小部分信息会进入”意识可及”的共享工作空间,用于语言报告和灵活推理。
关键技术”J-lens”:基于Jacobian矩阵的新解释性技术,让研究人员能够读取模型的”静默推理”——也就是模型在生成输出之前正在考虑的概念。实验显示:
- 当你让Claude想一种运动时,”足球”这个概念会在J-space中激活,早于语言输出
- 人工编辑J-space中的表征(比如把”足球”换成”橄榄球”),可以因果性地改变模型的输出,成功率高达70%
- J-space中的表征是高度连接的枢纽,接收和广播的信息远多于普通激活
安全应用:在欺骗/诚实探测实验中,J-space常常包含”假的”、”虚构的”或”诚实”相关概念,早于输出出现。这意味着模型在内部已经”察觉”到场景的性质。删除这些监控概念会增加不诚实行为,证明了其因果相关性。
Anthropic明确强调:这项研究是功能性的(关于可访问意识/可报告推理),不涉及现象意识、主观体验或情感,也不声称当前AI系统具有意识。
总结
J-space的发现是2026年AI可解释性领域最激动人心的进展之一。它不仅让我们第一次”看到”了大语言模型内部的”思考过程”,还为AI安全提供了新的干预手段——如果我们能读取和编辑模型的内部表征,也许就能更好地确保它们的行为符合我们的期望。这项研究的影响可能会持续很多年。
本文地址:https://www.163264.com/14505


微信扫一扫,鼓励一下~