一句话结论:德国 AI 公司 Aleph Alpha 于 10 月 3 日(德国统一日)开源 Kolibri,78B 参数、384 专家路由、Apache 2.0 许可证、百万 token 上下文,声称以 3.46B 活跃参数可媲美四倍规模的竞品,在 AIME 2025/2026 和 GPQA diamond 等基准上领先,但在工具调用和幻觉指标上弱于 Qwen3.6-35B——权重开放,数字自评,欧盟合规是核心卖点。
背景:德国统一日,德国人开源了一个大模型
Aleph Alpha 选在 10 月 3 日德国统一日(German Reunification Day)发布 Kolibri,不是巧合。这家总部位于海德堡的公司想传递的信息很明确: Kolibri 是「欧洲基础设施」,不是又一个刷榜的创业公司。 Aleph Alpha 已签署欧盟《通用人工智能(GPAI)行为准则》,训练数据存于德国和芬兰基础设施,整条 pipeline(数据、预训练、后训练、Serving)自持。
Aleph Alpha 成立于 2019 年,定位为「欧洲主权 AI」代表,与美国和中国的 AI 巨头错位竞争。 Kolibri 是其 Model Factory 流水线第二款产品——第一款 Kolibri Origin 是 30B 模型(3B 活跃参数,65k 上下文);从 Origin 到 Kolibri,团队用了约三个月。
技术规格:78B、384 专家、6 路路由、百万上下文
Kolibri 是一个德英双语混合专家(MoE)Transformer,规格如下:
- 总参数:78,103,074,560(约 78B)
- 活跃参数:每次推理激活约 3.46B(即官方博客四舍五入的「3B 活跃」)
- 专家数:384 个专家,每次激活 6 个
- 上下文窗口:100 万 token(超过 262,144 token 需要 –max-model-len 1048576 额外参数)
- 许可证:Apache 2.0(罕见——通常追求「主权」的公司会选择更限制性的许可)
- 分词器:德英双语定制,语料构成约 62.5% 英语、23.9% 德语、13.6% 代码,总训练 token 数约 20T
- 发布日期:2026 年 10 月 3 日,Hugging Face 仓库同日上线
基准成绩:Aleph Alpha 自评,赢 AIME、输工具调用
Aleph Alpha 在官方博客附上了与三个竞品的对比表,但所有数字均为 Aleph Alpha 自行测试,非第三方独立评估。
| 基准 | Kolibri | Qwen3.6-35B-A3B | Nemotron 3 Super 120B-A12B | Mistral Small 4 119B-A6B |
|---|---|---|---|---|
| AIME 2025 | 96.9 | 84.6 | 91.7 | 79.8 |
| AIME 2025 (DE) | 87.5 | 82.9 | 85.6 | 72.3 |
| AIME 2026 | 96.0 | 91.0 | 90.4 | 83.1 |
| AIME 2026 (DE) | 90.0 | 84.4 | 87.5 | 78.5 |
| GPQA diamond | 84.3 | 83.4 | 78.0 | 74.7 |
| GPQA diamond (DE) | 81.3 | 80.6 | 76.6 | 72.9 |
| AA-Omniscience(幻觉指数,越高越差) | -32.8 | -15.3 | -36.5 | -24.0 |
| tau2-bench retail(工具调用) | 69.9 | 71.6 | 67.5 | 62.9 |
| tau2-bench telecom(工具调用) | 94.7 | 99.1 | 68.1 | 41.5 |
| BFCL v4 overall | 61.4 | 67.2 | 61.0 | 58.0 |
| LiveCodeBench v6 | 85.9 | 82.5 | 82.0 | 71.2 |
| HumanEval+ | 92.7 | 92.8 | 94.7 | 92.8 |
| SWE-Bench Verified | 66.4 | — | — | — |
| LongBench Pro | 64.5 | 70.8 | 62.9 | 56.4 |
| AA-LCR | 68.3 | 69.7 | 67.0 | 52.3 |
| 垂直领域 | Kolibri Origin(30B 基线) | Kolibri(78B) |
|---|---|---|
| 汽车供应商 | 0.72 | 0.99 |
| 半导体 | 0.35 | 0.80 |
| 德国公共部门 | 0.54 | 0.75 |
| 工业驱动技术 | 0.31 | 0.60 |
| 航空航天 | 0.14 | 0.59 |
这些数字描述的是微调后部署场景的相对提升,不是原始基准分。
常见问题
Kolibri 和 Qwen3.6-35B 相比,到底谁更强?
取决于任务类型。 Kolibri 在 AIME(数学推理)、GPQA diamond(研究生级科学问答)和长上下文(LongBench Pro)上领先;在工具调用(tau2-bench retail/telecom、BFCL v4)和代码(HumanEval+)上弱于 Qwen3.6-35B。 Aleph Alpha 的核心主张是「3.46B 活跃媲美四倍规模竞品」,这主要依赖 AIME 和 GPQA 数字,但如果你的场景是 Agent 工具调用,Qwen3.6 可能是更好的选择。
Apache 2.0 许可证意味着什么?企业可以直接商用吗?
是的,Apache 2.0 允许商业使用、修改和分发,无需向 Aleph Alpha 付费或申请许可。但对于需要在 GDPR 合规框架下处理欧盟公民数据的场景,整套合规方案(数据来源、训练基础设施、模型行为审计)才是 Aleph Alpha 的差异化卖点,这部分通常需要商业协议。
为什么 Aleph Alpha 把发布时间选在德国统一日?
Aleph Alpha 明确表示这是有意为之。德国统一日是德国最重要的国庆节日,选择这一天发布是想传递「欧洲本土 AI 基础设施」的定位,而非「又一家 AI 创业公司的开源模型」。公司已签署欧盟 GPAI 行为准则,强调训练数据存于欧洲本土、整条 pipeline 自持,以满足欧洲监管机构对数据主权的期待。
小结
Kolibri 是一款真实发布的开源权重模型:78B 总参数、Apache 2.0、百万 token 上下文、德英双语,加上欧盟合规背景——比大多数「主权 AI 宣言」更有实质内容。其 AIME 和 GPQA 成绩(均为自评)证明了小规模活跃参数高效推理的可行性,但在工具调用和代码生成上与 Qwen3.6-35B 仍有差距。社区反馈总体积极,主要肯定点是德语原生能力和低幻觉特性。对于需要德语处理能力或追求欧盟数据合规的企业,Kolibri 是目前最具实质内容的选项之一。
相关阅读
- DeepSeek 开源昇腾组件:375GB/s 互联、5102 tokens/s 推理
- Cloudflare 开源 Clef 决策模型:39ms 出结果,让 AI Agent 路由不再卡壳
- AWS 开源 Strands Decider 2B:亚100毫秒选出最优智能体路径
延伸阅读
- Cumora:yetone 开源的 AI Agent 团队协作平台,AI 作为一等公民降临团队沟通2 周前
- 麦肯锡:AI 十年内或迫使 1100 万美国人转行,低收入者中招概率是高收入者 8 倍5 天前
- DeepSeek V4 Flash 正式版来了:Terminal Bench 2.1 冲到 82.7,Agent 能力大幅超越预览版2 月前
- 百度文库网盘 AI 办公出海:库库 AI 全球月活超 4000 万,海外版 Kooko 一年内用户破 1000 万2 周前
