月之暗面2026年7月27日宣布 Kimi K3 开放权重。这是该公司能力最强的模型:2.8万亿参数的混合专家(MoE)模型,具备原生视觉理解能力,支持100万token上下文。阿里同步开源支撑 Kimi K3 训练的三项关键 Infra 技术:MoonEP(高性能 MoE 通信库)、FlashKDA(Kimi Delta Attention 高性能算子)和 AgentEnv(分布式强化学习沙箱)。
2.8万亿参数 MoE,规模化不只靠堆参数
Kimi K3 参数规模是上一代 Kimi K2.5 的约3倍。这不是简单的参数堆叠——在并不宽裕的算力条件下,月之暗面凭借 Kimi Delta Attention(KDA)、Attention Residuals(AttnRes)以及 MoonEP 等一系列技术创新,实现了在有限算力下训练超大模型的能力突破。
Kimi K3 具备原生视觉理解能力,支持100万token的超长上下文窗口,可处理长文档、长视频和复杂的多轮对话任务。模型权重现已开放下载,可用于内部研发或嵌入面向终端用户的产品(具体使用情形见 Kimi K3 许可证)。
技术报告:KDA+AttnRes 与 Stable LatentMoE
Kimi K3 技术报告同步公开,核心技术创新包括:
KDA + AttnRes:以3:1比例混合 Kimi Delta Attention 与 Gated MLA,实现高效长上下文建模;通过块级注意力残差增强跨层信息流动,使模型在超长序列上依然保持稳定的注意力分布。
Stable LatentMoE:每个 token 从896个路由专家中激活16个,并通过 SiTU-GLU 与 Quantile Balancing 保持极高稀疏度下的训练稳定。这是 K3 能在2.8万亿参数规模下保持训练收敛的关键。
MoonViT-V2:视觉编码器从零开始使用 next-token prediction 训练,无需对比预训练,在达到 SigLIP 初始化基线效果的同时获得更稳定的优化过程。
后训练阶段,团队在通用推理、通用 Agent 和编程 Agent 三大领域进行大规模任务合成,搭建了百万 token 上下文强化学习基建,并在近20个内部评测集上完成完整评估。
Infra 开源一:MoonEP 高性能 MoE 通信库
MoonEP 是月之暗面为超大细粒度 MoE 打造的高性能通信库,让专家并行(expert-parallel)的通信在不均衡的情况下依然实现极致效率。MoE 架构中,不同行使不同专家的 token 分布往往不均衡,传统通信库在这种情况下效率骤降。MoonEP 针对这一场景专门优化,确保在真实负载(而非实验室均匀分布)下依然高效。
Infra 开源二:FlashKDA 高性能注意力算子
FlashKDA 是 Kimi Delta Attention 的高性能 kernel 实现。在英伟达 H20 上,相比 flash-linear-attention 基线,FlashKDA 的 prefill 速度提升1.72至2.22倍,可直接作为 flash-linear-attention 的替换后端。H20 是面向中国市场的特供 GPU,FlashKDA 的这一优化对在国内算力集群上部署 K3 系列模型有直接价值。
Infra 开源三:AgentEnv 分布式 RL 沙箱
AgentEnv 是月之暗面与 KVCache.ai 合作开发的沙箱系统,用于大规模运行 Agent 环境。它为 Kimi K3 的后训练提供高保真、强隔离的沙箱环境,灵活支持快速快照、恢复和分叉(fork)等操作,可应对大规模并行的 Agent 工作流与训练任务。这是 K3 在编程 Agent 和通用 Agent 能力上大幅提升的工程基础。
Kimi K3 关键参数一览
| 指标 | Kimi K3 | Kimi K2.5(参考) | 说明 |
|---|---|---|---|
| 总参数量 | 2.8 万亿(MoE) | 约 0.9 万亿 | 约 3 倍规模 |
| 激活专家数 | 每次激活 16 个(共 896 个) | — | SiTU-GLU + Quantile Balancing |
| 视觉理解 | 原生支持 | — | MoonViT-V2 视觉编码器 |
| 上下文窗口 | 100 万 token | — | KDA + AttnRes 长上下文建模 |
| FlashKDA 加速 | prefill 1.72-2.22 倍 | — | H20 实测 vs flash-linear-attention |
| 许可证 | Kimi K3 License | — | 权重可自由下载使用 |
为什么选择开源?
月之暗面在公告中表示,开放权重模型能降低获取智能的门槛,推动创新,并赋予用户对数据更大的控制权、隐私保护和所有权。「对于 AGI 这样具有深远影响的技术,一个广泛、开放的生态系统是最适合承载它的土壤。」过去几周,月之暗面听到了来自 AI 社区和技术领袖的支持声音。Kimi K3 的开源,被视为中国大模型公司开放战略的重要一步。
相关阅读
- MiniMax H3发布:打破任务边界的全模态生成模型,2K视频价格不到主流1/3
- Qwen3.8-Omni-Flash发布:原生全模态Agent,29项基准涨25%,音视频API降幅超93%
- Qwen-Drive-1.0:首个统一3D感知与运动规划的自动驾驶视觉-语言模型
FAQ
Kimi K3 与 Kimi K2.5 相比最大升级是什么?
参数规模从约0.9万亿提升至2.8万亿(3倍),同时具备原生视觉理解和100万token超长上下文。更重要的是,月之暗面通过 KDA+AttnRes 和 Stable LatentMoE 等技术创新,在有限算力下实现了超大模型的高效训练。
MoonEP、FlashKDA、AgentEnv 分别解决什么问题?
MoonEP 解决 MoE 模型专家并行通信效率问题;FlashKDA 将 Delta Attention 算子加速1.72-2.22倍(H20实测),降低部署成本;AgentEnv 提供高保真强隔离的 RL 训练沙箱,是 K3 编程和 Agent 能力提升的工程基础。
Kimi K3 开源意味着什么?
Kimi K3 权重可自由下载用于内部研发和产品嵌入,降低了企业和开发者使用顶级国产大模型的门槛。FlashKDA 和 MoonEP 的开源对在中国算力集群(尤其是 H20)上部署 MoE 模型有直接工程价值。
延伸阅读
- 讯飞智文 Agent 升级:PPT 一键导出可编辑成稿,文档润色与美学排版同步增强3 周前
- Cumora:yetone 开源的 AI Agent 团队协作平台,AI 作为一等公民降临团队沟通3 周前
- Qwen-Drive-1.0:首个统一3D感知与运动规划的自动驾驶视觉-语言模型3 小时前
- Claude Code Projects 转向并行分支:Anthropic 日跑 3 万 Agent,研发占比 26%3 周前
