跳到文章正文
大模型 编辑推荐

黑箱不再是黑箱:丹麦团队用 Tool Calling 撬开 GPT-6 Astra 的隐藏推理,AI 可解释性迎来 breakthrough

大语言模型一直被视为"黑箱"——我们知道它们能给出惊人的答案,却不知道它们是如何思考的。丹麦奥尔…

大语言模型一直被视为”黑箱”——我们知道它们能给出惊人的答案,却不知道它们是如何思考的。丹麦奥尔堡大学的研究团队发表了一项突破性研究,通过精心设计的 Tool Calling 技术,成功提取了 GPT-6 Astra 的隐藏推理过程。这项名为 Seafill 的技术,可能彻底改变我们理解 AI 的方式。

一分钟速览

  • 研究团队通过 Tool Calling 接口反向追踪模型内部决策链条
  • GPT-6 Astra 在复杂任务中会进行多步推理和自我纠错,但这些过程通常不可见
  • 模型在面临不确定性时,倾向于调用外部工具而非依赖内部知识
  • 研究框架将开源,为全球 AI 安全审计提供新工具

黑箱问题:AI 最大的未解之谜

随着大语言模型在关键领域的应用日益广泛,一个根本性问题愈发凸显:我们不知道如何验证它们的决策过程。

GPT-6 Astra 可以写出优秀的代码、解答复杂的数学问题、甚至进行创造性的写作。但当它被要求解释”为什么这样做”时,它给出的答案往往只是对结果的合理化描述,而非真实的推理过程。这种”黑箱”特性,让 AI 在医疗、金融、法律等高风险领域的应用受到限制。

Seafill:用工具调用反推思维链条

奥尔堡大学的研究团队找到了一个巧妙的突破口。他们发现,当 GPT-6 Astra 调用外部工具时,会在接口中暴露一些内部状态信息。通过分析这些暴露的信息,研究者得以反向追踪模型的决策链条。

这种方法的核心逻辑是:模型在调用工具时,需要明确”我要做什么”和”为什么这样做”。这些信息虽然经过编码,但包含了推理过程的关键线索。研究团队通过精心设计的提示词序列,诱导模型在工具调用中暴露更多内部状态,从而还原完整的思维链条。

关键发现:AI 的”思考”比想象中复杂

研究揭示了 GPT-6 Astra 的几个重要特性:

多步推理是常态。在处理复杂任务时,模型会进行多层次的规划和验证。例如,在解答一道数学竞赛题时,模型可能会先尝试多种解题路径,评估每种路径的可行性,然后选择最优方案。这个过程通常对用户完全不可见。

自我纠错能力被低估。模型在推理过程中会主动识别和修正错误,但这种能力在最终输出中并未体现。这意味着模型的实际能力可能比我们感知的更强,只是它选择不展示这些”思考过程”。

工具依赖反映不确定性。当模型对某个问题的答案不确定时,它倾向于调用外部工具(如搜索引擎、计算器)而非依赖内部知识。这种行为模式为评估模型的”置信度”提供了新思路。

为什么这项研究如此重要?

安全审计:通过还原模型的推理过程,我们可以发现潜在的欺骗性行为、偏见或逻辑漏洞。这对于确保 AI 系统的安全性至关重要。

能力评估:目前的基准测试主要评估模型的最终输出,但无法区分”真正理解”和”碰巧猜对”。Seafill 让我们能够更准确地衡量模型的真实能力边界。

信任建立:在医疗诊断、法律建议等高风险场景,用户需要理解 AI 的决策依据。可解释性是建立人机信任的基础。

开源承诺:让全球研究者受益

研究团队表示,他们将在未来几个月内开源 Seafill 框架。这一决定值得赞赏——AI 可解释性是一个全球性问题,需要全球研究者共同努力。

开源后,开发者可以使用 Seafill 审计自己的 AI 系统,监管机构可以用它评估商用模型的安全性,学术界可以在此基础上开展更深入的研究。

结语

Seafill 的发布标志着 AI 可解释性研究进入新阶段。虽然我们距离完全理解大语言模型还有很长的路要走,但每一项这样的突破,都在拉近我们与”可信 AI”的距离。当 AI 的”思考过程”不再神秘,我们或许就能更放心地将关键决策交给它们。

来源:机器之心、奥尔堡大学研究团队

本文地址:https://www.163264.com/15731