美团 LongCat-2.0 开源:1.6T 参数每 token 激活 33B–56B,首个五万卡国产集群推理的万亿模型

7 月 6 日消息,据 IT之家报道,美团已将万亿参数大模型 LongCat-2.0 正式开源,并同步开放面向国产算力优化的推理代码。公开信息显示,LongCat-2.0 总参数规模 1.6T,平均激活参数约 48B,官方页面进一步给出每个 token 动态激活约 33B–56B 的区间,并支持原生 1M 上下文。更受关注的另一条信息是:官方介绍称,LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型。

结论先行:这不是一个“聊天更强”的模型

把参数数字放在一边,LongCat-2.0 的定位其实相当克制:面向真实 Agentic Coding 任务,而非通用对话。模型围绕长上下文、代码任务、Agent 执行和错误恢复几个方向设计,适用场景是代码生成、代码理解、软件工程任务执行、长上下文代码库分析、自动化开发流程与 Agentic Coding 应用构建。换句话说,它要解决的不是“回答得更好听”,而是“能不能把一个工程任务跑完”。

关键参数与技术要点

项目 公开口径 工程含义
总参数 1.6T 容量足够容纳长尾代码与领域知识
平均激活参数 约 48B 推理开销远低于同参数量稠密模型
每 token 动态激活 约 33B–56B 按 token 难度分配算力,简单 token 少算、关键 token 多算
上下文长度 原生 1M 可整体读入大型代码库,减少分块带来的语义割裂
精度版本 BF16 / FP8 / INT8 覆盖从高端卡到显存受限平台的部署需求
算力适配 五万卡国产算力集群完成推理 面向显存、带宽受限芯片做架构—芯片—部署协同优化

LongCat 稀疏注意力:为长上下文让出算力

模型引入 LongCat 稀疏注意力用于提升长上下文处理效率。1M 上下文的代价在于注意力的计算与访存开销,全注意力在百万级长度上几乎不可用;稀疏化是让长上下文从“能跑”走向“能常态化使用”的必经路径。对代码场景尤其关键——分析一个大型仓库时,真正相关的往往只是少数几个文件与调用链。

N-gram Embedding:增强 token 级表示

另一项是 N-gram Embedding,用于增强 token 级表示能力。代码与自然语言的一个重要差别是大量出现固定搭配:API 名称、样板结构、惯用写法。把这类多 token 片段的表示能力前移,理论上可以降低模型在生成长标识符、完整调用语句时的出错率。

动态激活机制:把算力花在难的 token 上

结合动态激活机制后,模型面向代码理解、代码生成和任务执行做了优化。每个 token 激活 33B–56B 的区间意味着激活量不是固定的——这类设计的目标是在不牺牲关键推理步骤质量的前提下压低平均开销,这也是 1.6T 总参数能把平均激活控制在 48B 的原因。

为什么“国产算力推理代码”比模型权重更值得注意

开源模型权重在当下已不算稀缺,真正稀缺的是能在特定硬件上跑得起来的完整方案。LongCat-2.0 同步开放了面向国产算力平台优化的推理成果:据官方介绍,此次针对显存、带宽受限的国产算力芯片,在模型架构、芯片适配和部署策略上进行了协同优化。

这句话里的“协同优化”是重点。很多开源模型的国产卡适配停留在“把算子跑通”,性能损耗可能达到数倍;而架构层面的配合(比如稀疏策略、精度选择、并行切分方式)需要在模型设计阶段就考虑进去,事后打补丁很难补回。这次同时给出 BF16、FP8、INT8 多精度版本,也是为了让不同算力档位都能找到可落地的配置。

精度 显存占用特征 适合场景
BF16 最高 效果优先、硬件充裕的训练与评测环境
FP8 约为 BF16 的一半量级 生产环境主力部署,兼顾效果与吞吐
INT8 最低 显存与带宽受限平台、成本敏感的大批量调用

需要说明:上表对精度特性的描述属于通用的工程常识归纳,并非美团官方给出的对比数据;具体性能表现应以官方发布的部署文档与实测结果为准。

它适合用来做什么

按官方定位,LongCat-2.0 的核心方向并不是通用聊天,而是代码与智能体任务。落到具体用途,可以对应以下几类:

场景 为什么适配
长上下文代码库分析 原生 1M 上下文可整体读入仓库,跨文件依赖更容易理清
代码生成与理解 动态激活与 N-gram Embedding 面向 token 级准确性优化
Agentic Coding 应用构建 围绕 Agent 执行与错误恢复设计,适合长链路任务
自动化开发流程 多精度版本便于在国产算力环境下规模化部署
国产化替代评估 提供国产算力集群上的实测推理路径,降低验证成本

“错误恢复”这一点在 Agentic Coding 里常被低估。真实工程任务很少一次跑通,智能体能否识别失败、回滚到可用状态、换路径重试,往往比首次生成的正确率更决定整体成功率。官方把这列为设计方向之一,说明侧重点确实在工程闭环,而非单次输出质量。

常见问题

Q1:LongCat-2.0 的总参数和激活参数分别是多少?

据公开信息,LongCat-2.0 总参数规模为 1.6T,平均激活参数约 48B;官方页面进一步说明其具备每个 token 动态激活约 33B–56B 参数的能力。也就是说,模型容量是万亿级,但单次推理的实际开销接近一个中等规模模型。

Q2:它和通用大模型的主要区别在哪?

定位不同。LongCat-2.0 面向真实 Agentic Coding 任务,围绕长上下文、代码任务、Agent 执行和错误恢复设计,适用场景是代码生成、代码理解、软件工程任务执行、长上下文代码库分析与自动化开发流程,而不是通用对话与问答。

Q3:国产算力部署方面提供了什么?

美团同步开放了面向国产算力平台优化的推理成果。据官方介绍,LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,并针对显存、带宽受限的国产算力芯片,在模型架构、芯片适配和部署策略上做了协同优化;部署层面提供 BF16、FP8、INT8 多精度版本。

写在最后

LongCat-2.0 最值得琢磨的地方,是把“开源”这件事从开放权重推进到了开放可运行路径。1.6T 参数、1M 上下文、33B–56B 动态激活这些数字决定能力上限,而五万卡国产集群的推理验证决定它在现实算力约束下能不能被用起来。对开发者和企业团队来说,真正降低试用门槛的往往不是模型有多大,而是有没有一份能照着跑起来的部署方案。随着大模型进入真实业务场景,围绕“任务执行”与“国产算力部署”同时做优化的模型,大概率会成为企业级落地的重要一支。