德国 AI 独苗 Aleph Alpha 开源 Kolibri:78B MoE、100万上下文、Apache 2.0,剑指欧洲主权

一句话结论:德国 AI 公司 Aleph Alpha 于 10 月 3 日(德国统一日)开源 Kolibri,78B 参数、384 专家路由、Apache 2.0 许可证、百万 token 上下文,声称以 3.46B 活跃参数可媲美四倍规模的竞品,在 AIME 2025/2026 和 GPQA diamond 等基准上领先,但在工具调用和幻觉指标上弱于 Qwen3.6-35B——权重开放,数字自评,欧盟合规是核心卖点。

背景:德国统一日,德国人开源了一个大模型

Aleph Alpha 选在 10 月 3 日德国统一日(German Reunification Day)发布 Kolibri,不是巧合。这家总部位于海德堡的公司想传递的信息很明确: Kolibri 是「欧洲基础设施」,不是又一个刷榜的创业公司。 Aleph Alpha 已签署欧盟《通用人工智能(GPAI)行为准则》,训练数据存于德国和芬兰基础设施,整条 pipeline(数据、预训练、后训练、Serving)自持。

Aleph Alpha 成立于 2019 年,定位为「欧洲主权 AI」代表,与美国和中国的 AI 巨头错位竞争。 Kolibri 是其 Model Factory 流水线第二款产品——第一款 Kolibri Origin 是 30B 模型(3B 活跃参数,65k 上下文);从 Origin 到 Kolibri,团队用了约三个月。

技术规格:78B、384 专家、6 路路由、百万上下文

Kolibri 是一个德英双语混合专家(MoE)Transformer,规格如下:

  • 总参数:78,103,074,560(约 78B)
  • 活跃参数:每次推理激活约 3.46B(即官方博客四舍五入的「3B 活跃」)
  • 专家数:384 个专家,每次激活 6 个
  • 上下文窗口:100 万 token(超过 262,144 token 需要 –max-model-len 1048576 额外参数)
  • 许可证:Apache 2.0(罕见——通常追求「主权」的公司会选择更限制性的许可)
  • 分词器:德英双语定制,语料构成约 62.5% 英语、23.9% 德语、13.6% 代码,总训练 token 数约 20T
  • 发布日期:2026 年 10 月 3 日,Hugging Face 仓库同日上线

基准成绩:Aleph Alpha 自评,赢 AIME、输工具调用

Aleph Alpha 在官方博客附上了与三个竞品的对比表,但所有数字均为 Aleph Alpha 自行测试,非第三方独立评估。

在 Hacker News 社区讨论中,一位用户(pettijohn)评价:「看起来在德语文档阅读和推理上表现不错。定制德语分词器,而且据称是幻觉最少的模型之一。」社区同时出现了一个关于德国 AI「必须能处理传真机」的玩笑梗(暗讽德国企业数字化的老问题)。

两个差异化设计:拒答机制与德语能力

Kolibri 的表格背后有两个值得注意的设计选择:

拒答(Abstention)机制:Kolibri 内置了 Merlin-Arthur 协议的拒答训练,当上下文信息不足以支撑答案时,模型会选择说「我不知道」而非胡编乱造。从 AA-Omniscience 幻觉指数看(-32.8,越高越差,即数字越负表示幻觉越少),Kolibri 在 Aleph Alpha 的评估中是四款模型里幻觉最少的,但这同样也是 Aleph Alpha 自评的数字。

德语能力:Kolibri 的定制双语分词器和德语加权预训练语料(21.3% 德语 token)支撑了德语基准的领先。但 Aleph Alpha 也承认,其翻译流程覆盖了约 6% 的总 token,这意味着部分「德语能力」实际上来自翻译而非原生训练。

开源许可证:为什么一家「主权 AI」公司选择了 Apache 2.0

Apache 2.0 是最宽松的开源许可证之一,允许商用、修改和闭源衍生——对于一家以「欧洲数据主权」为核心卖点的公司而言,这个选择令人意外。Aleph Alpha 官方解释是:权重开放本身就是为了让欧洲机构能在自己的基础设施上部署,「许可证越宽松,部署摩擦越小」。

对于需要更强合规背书的客户,Aleph Alpha 还提供商业支持协议和定制化部署服务,这是其商业模式的主要来源。

应用场景:欧洲企业和公共部门的垂直部署

Aleph Alpha 在官方博客中列出了内部垂直基准(均为自评)改善数据:

基准 Kolibri Qwen3.6-35B-A3B Nemotron 3 Super 120B-A12B Mistral Small 4 119B-A6B
AIME 2025 96.9 84.6 91.7 79.8
AIME 2025 (DE) 87.5 82.9 85.6 72.3
AIME 2026 96.0 91.0 90.4 83.1
AIME 2026 (DE) 90.0 84.4 87.5 78.5
GPQA diamond 84.3 83.4 78.0 74.7
GPQA diamond (DE) 81.3 80.6 76.6 72.9
AA-Omniscience(幻觉指数,越高越差) -32.8 -15.3 -36.5 -24.0
tau2-bench retail(工具调用) 69.9 71.6 67.5 62.9
tau2-bench telecom(工具调用) 94.7 99.1 68.1 41.5
BFCL v4 overall 61.4 67.2 61.0 58.0
LiveCodeBench v6 85.9 82.5 82.0 71.2
HumanEval+ 92.7 92.8 94.7 92.8
SWE-Bench Verified 66.4 — — —
LongBench Pro 64.5 70.8 62.9 56.4
AA-LCR 68.3 69.7 67.0 52.3
垂直领域 Kolibri Origin(30B 基线) Kolibri(78B)
汽车供应商 0.72 0.99
半导体 0.35 0.80
德国公共部门 0.54 0.75
工业驱动技术 0.31 0.60
航空航天 0.14 0.59

这些数字描述的是微调后部署场景的相对提升,不是原始基准分。

常见问题

Kolibri 和 Qwen3.6-35B 相比,到底谁更强?

取决于任务类型。 Kolibri 在 AIME(数学推理)、GPQA diamond(研究生级科学问答)和长上下文(LongBench Pro)上领先;在工具调用(tau2-bench retail/telecom、BFCL v4)和代码(HumanEval+)上弱于 Qwen3.6-35B。 Aleph Alpha 的核心主张是「3.46B 活跃媲美四倍规模竞品」,这主要依赖 AIME 和 GPQA 数字,但如果你的场景是 Agent 工具调用,Qwen3.6 可能是更好的选择。

Apache 2.0 许可证意味着什么?企业可以直接商用吗?

是的,Apache 2.0 允许商业使用、修改和分发,无需向 Aleph Alpha 付费或申请许可。但对于需要在 GDPR 合规框架下处理欧盟公民数据的场景,整套合规方案(数据来源、训练基础设施、模型行为审计)才是 Aleph Alpha 的差异化卖点,这部分通常需要商业协议。

为什么 Aleph Alpha 把发布时间选在德国统一日?

Aleph Alpha 明确表示这是有意为之。德国统一日是德国最重要的国庆节日,选择这一天发布是想传递「欧洲本土 AI 基础设施」的定位,而非「又一家 AI 创业公司的开源模型」。公司已签署欧盟 GPAI 行为准则,强调训练数据存于欧洲本土、整条 pipeline 自持,以满足欧洲监管机构对数据主权的期待。

小结

Kolibri 是一款真实发布的开源权重模型:78B 总参数、Apache 2.0、百万 token 上下文、德英双语,加上欧盟合规背景——比大多数「主权 AI 宣言」更有实质内容。其 AIME 和 GPQA 成绩(均为自评)证明了小规模活跃参数高效推理的可行性,但在工具调用和代码生成上与 Qwen3.6-35B 仍有差距。社区反馈总体积极,主要肯定点是德语原生能力和低幻觉特性。对于需要德语处理能力或追求欧盟数据合规的企业,Kolibri 是目前最具实质内容的选项之一。

相关阅读