Transformer上限触顶?上海AI实验室提出Mobius架构,知识与推理分离成新方向

核心看点

前OpenAI推理负责人Jerry Tworek与前Google Gemini预训练负责人Rohan Anil近期公开表态:Transformer已经走到尽头,成为通往AGI的最大瓶颈。上海人工智能实验室提出的Mobius架构,通过知识与推理分离,为下一代模型架构探索出一条全新路径。

Transformer的「三宗罪」

自2017年问世以来,Transformer通过不断Scaling数据量和参数量,取得了举世瞩目的成就。但这座大厦的地基始终存在三个致命缺陷:

  • 学过的,不能快速回想起来 —— 模型需要超长思维链(CoT)才能激发潜力,推理效率极低
  • 新学的,想要记好,成本太高 —— 持续学习需要重新预训练,成本不可接受
  • 没学的,难以通过联想构建 —— 在科学发现等需要直觉和联想的领域,组合泛化能力严重不足

Mobius的解题思路:知识与推理分离

Mobius团队认为,上述问题的根源在于分层的记忆与推理机制。在Transformer中,全连接层(FFN)负责记忆存储,注意力层(Attn)负责组合推理,但两者紧密耦合,导致知识提取和推理效率都受到限制。

Mobius架构的核心创新是解耦知识与推理

  • 独立的记忆模块,实现高密度知识存储
  • 独立的推理模块,专注于组合和泛化
  • 两者可以独立优化,不再相互掣肘

这意味着什么?

如果Mobius的路线被验证成功,AI模型将可能实现:

  • 真正的持续学习 —— 新知识可以低成本注入,不遗忘旧知识
  • 高效的推理 —— 不再需要超长CoT,推理速度大幅提升
  • 更强的组合泛化 —— 不同知识可以同时激活,产生「灵感迸发」

总结

Transformer的Scaling Law正在触及天花板,这不是悲观的信号,而是架构创新的起点。Mobius的探索表明,下一代AI架构可能不再追求「更大」,而是追求「更聪明」—— 让知识和推理各司其职,或许才是通往AGI的正确道路。

论文:Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
GitHub: github.com/InternLM/Intern-S2-Mobius

本文地址:https://www.163264.com/14663

(0)
上一篇 1天前
下一篇 1天前

相关推荐