腾讯混元 Hy3 正式版开源:295B 总参数 21B 激活 MoE,256K 上下文 API 输入 1 元

7 月 6 日,腾讯混元正式发布并开源 Hy3 大语言模型。与 4 月的 Hy3 Preview 不同,这次是正式版本,腾讯已在 Hugging Face、ModelScope、GitCode 和 CNB 等平台开放 Hy3 与 Hy3-FP8 模型权重。规格上,Hy3 采用 MoE 混合专家架构,总参数 295B、激活参数 21B,含 3.8B MTP 层参数,支持 256K 上下文,API 输入价格 1 元/百万 tokens。

从 Preview 到正式版改了什么

Hugging Face 模型卡显示,Hy3 由 Tencent Hy Team 研发,是在 Hy3 Preview 之后基于来自 50 多个产品团队的反馈继续优化的成果。官方提到,Hy3 在 Preview 基础上提升了后训练数据质量与多样性,并扩大了强化学习训练规模,重点改善推理、智能体工作流和长上下文任务表现。

“50 多个产品团队的反馈”这个说法值得留意——它意味着这一版迭代的输入主要来自真实业务场景,而不是纯粹的榜单驱动。腾讯云产品页也将其描述为”基于真实业务场景打磨”。

关键规格一览

项目 Hy3 正式版
架构 MoE 混合专家
总参数量 295B
激活参数量 21B
MTP 层参数 3.8B
上下文长度 256K
思考模式 no_think / think_low / think_high
开源权重 Hy3、Hy3-FP8(HF、ModelScope、GitCode、CNB)

三档思考模式的意义

no_think、think_low、think_high 三档设计,本质上是把”为一次回答付出多少推理成本”的选择权交回给调用方。简单的检索改写可以用 no_think 压低延迟和成本,复杂的多步规划再切到 think_high。对日均调用量较大的业务来说,这种可调度的推理预算往往比单点跑分更能决定实际账单。

能力方向:推理、长上下文、代码与 Agent

Hy3 继续聚焦推理、长上下文、代码生成和 Agent 工作流四个方向。在真实生产力场景上,官方介绍提到 Hy3 在软件开发、办公生产、金融建模、前端设计、游戏制作等任务上的进步较为明显,目标是作为高性价比的模型选择。

API 定价

腾讯同步降低了 Hy3 的 API 调用成本。腾讯云 TokenHub 价格页面显示:

  • 输入:1 元 / 百万 tokens
  • 输出:4 元 / 百万 tokens
  • 缓存命中:0.25 元 / 百万 tokens

同一价格页面还显示,Hy3 preview 仍按输入长度分档计费。缓存命中价仅为输入价的四分之一,对多轮对话、长系统提示词、RAG 这类前缀复用率高的场景比较友好。

怎么部署

开发者可以通过腾讯云混元大模型、TokenHub 等云端服务接入 Hy3,也可以下载开源权重本地部署。Hugging Face 模型卡中给出了基于 vLLM 和 SGLang 的部署示例,并支持通过 OpenAI 兼容 API 方式调用。

需要注意的是,Hy3 总参数规模较大,官方建议在多卡高显存 GPU 环境中部署,生产环境可结合 FP8 版本与推理框架进行成本优化。这也是腾讯同时放出 Hy3-FP8 权重的原因——FP8 能把显存占用和推理成本压下来,代价是极少量精度损失。

常见问题

Hy3 和 Hy3 Preview 是同一个模型吗?

不是。Hy3 是正式版,基于 4 月发布的 Hy3 Preview 之后来自 50 多个产品团队的反馈继续优化,提升了后训练数据质量与多样性,并扩大了强化学习训练规模。

Hy3 的参数规模是多少?

采用 MoE 架构,总参数 295B、激活参数 21B,另有 3.8B MTP 层参数,支持 256K 上下文长度。

本地部署有什么硬件要求?

由于总参数规模较大,官方建议在多卡高显存 GPU 环境中部署,生产环境可结合 FP8 版本与 vLLM、SGLang 等推理框架做成本优化。

小结

Hy3 的正式版路线很清晰:不靠堆参数博眼球,而是把 295B/21B 的稀疏结构、256K 长上下文、可切换的三档思考模式和一个相当克制的 API 定价组合在一起,指向的是”能长期跑在生产环境里”的性价比模型。对于正在做国产开源模型选型的团队,它的价值更多体现在成本曲线而不是峰值跑分上——先按 no_think 跑通链路,再对关键环节升级推理档位,是更务实的用法。