德国也要「自己的大模型」:Aleph Alpha 开源 Kolibri,78B 只激活 3.5B,德语省 18% token
当全球的目光都盯着硅谷和北京的模型竞赛时,欧洲选择在德国统一日这天,交出了自己的答案。德国 AI…
文章目录
当全球的目光都盯着硅谷和北京的模型竞赛时,欧洲选择在德国统一日这天,交出了自己的答案。德国 AI 公司 Aleph Alpha 发布并开源了大模型 Kolibri——一个主打德语、可完全本地部署的「主权模型」。
一分钟速览
- Kolibri 总参数 78.1B,每个 token 仅激活 3.46B,采用 MoE 架构
- 原生双语(德语 / 英语),权重以 Apache 2.0 协议开源
- 为德语量身定制分词器,同样文本比对手少约 11%–18% 的 token
- 训练数据中德语占比 21.3%,约 4.3T token,强调「不做翻译腔」
- 最低 2 张 A100 80GB 即可运行,权重约 78GB(FP8)
什么叫「主权模型」
Aleph Alpha 把「主权」拆成两层。一是研发主权:由德国团队开发,训练跑在德国和芬兰的基础设施上,受欧洲法律管辖;二是部署主权:客户可以把模型装进自己的服务器,数据不出本地,同时继承合规与知识产权保护。为此 Kolibri 在设计之初就对齐了欧盟《人工智能法案》与 GDPR,公司也签署了欧盟通用人工智能(GPAI)行为准则。
技术上的三个巧思
其一,德语分词器。团队自研了 UniBPE 算法,用 12.8 万词表专门针对德语的构词法训练。效果很直观:对「Bundesverfassungsgericht」(联邦宪法法院)这个词,Kolibri 只需 2 个 token,而一些主流模型要用 6 个。整体算下来,处理德语文本能省下约 11% 到 18% 的 token——对按 token 计费的时代,这是实打实的成本优势。
其二,德语原生推理。很多推理模型即便面对德语提问,也是先用英语思考再翻译。Kolibri 用约 80 万条德语推理样本训练,可以「用德语想问题」,在德语 AIME 2025 上拿到 87.5 分,高于英伟达 Nemotron 3 Nano 的 84.4。
其三,减少幻觉的「梅林-亚瑟协议」。训练时引入三方博弈:亚瑟是正在训练的模型,梅林负责藏起部分文档让正确答案更容易,莫甘娜则专门藏起关键证据、诱导模型编造。这一机制让 Kolibri 在「不知道」时选择弃权或给出部分答案的比例达到 44%,远高于对手的 11%–24%。
它也不是没有短板
78B 的权重意味着运行内存需求接近 80GB,即便只激活 3.5B,全量权重仍必须常驻显存,硬件门槛不低。长上下文方面,它在 128K 长度上会输给 Qwen,要到 1M 才重新领先;工具链较新,需要搭配 Aleph Alpha 的 vLLM 插件,且存在版本锁定;此外它刻意只做德语和英语两种语言,「要深度不要广度」。
产品链接
趋势洞察
Kolibri 的意义不在于刷新某个榜单,而在于它把「AI 主权」从口号变成了可交付的产品:开源权重、本地部署、法律合规、语言原生。这背后是一个越发明显的趋势——在医疗、公共行政、工业、航天等对数据出境敏感的场景里,「用谁家的模型」已经不只是技术选型,而是合规与供应链安全问题。对美国和中国模型之外的那部分市场来说,一个能装进自家机房、吃透本国语言的模型,本身就是刚需。
本文地址:https://www.163264.com/16175