7 月 6 日,腾讯混元正式发布并开源 Hy3 大语言模型。与 4 月的 Hy3 Preview 不同,这次是正式版本,腾讯已在 Hugging Face、ModelScope、GitCode 和 CNB 等平台开放 Hy3 与 Hy3-FP8 模型权重。规格上,Hy3 采用 MoE 混合专家架构,总参数 295B、激活参数 21B,含 3.8B MTP 层参数,支持 256K 上下文,API 输入价格 1 元/百万 tokens。
从 Preview 到正式版改了什么
Hugging Face 模型卡显示,Hy3 由 Tencent Hy Team 研发,是在 Hy3 Preview 之后基于来自 50 多个产品团队的反馈继续优化的成果。官方提到,Hy3 在 Preview 基础上提升了后训练数据质量与多样性,并扩大了强化学习训练规模,重点改善推理、智能体工作流和长上下文任务表现。
“50 多个产品团队的反馈”这个说法值得留意——它意味着这一版迭代的输入主要来自真实业务场景,而不是纯粹的榜单驱动。腾讯云产品页也将其描述为”基于真实业务场景打磨”。
关键规格一览
| 项目 | Hy3 正式版 |
|---|---|
| 架构 | MoE 混合专家 |
| 总参数量 | 295B |
| 激活参数量 | 21B |
| MTP 层参数 | 3.8B |
| 上下文长度 | 256K |
| 思考模式 | no_think / think_low / think_high |
| 开源权重 | Hy3、Hy3-FP8(HF、ModelScope、GitCode、CNB) |
三档思考模式的意义
no_think、think_low、think_high 三档设计,本质上是把”为一次回答付出多少推理成本”的选择权交回给调用方。简单的检索改写可以用 no_think 压低延迟和成本,复杂的多步规划再切到 think_high。对日均调用量较大的业务来说,这种可调度的推理预算往往比单点跑分更能决定实际账单。
能力方向:推理、长上下文、代码与 Agent
Hy3 继续聚焦推理、长上下文、代码生成和 Agent 工作流四个方向。在真实生产力场景上,官方介绍提到 Hy3 在软件开发、办公生产、金融建模、前端设计、游戏制作等任务上的进步较为明显,目标是作为高性价比的模型选择。
API 定价
腾讯同步降低了 Hy3 的 API 调用成本。腾讯云 TokenHub 价格页面显示:
- 输入:1 元 / 百万 tokens
- 输出:4 元 / 百万 tokens
- 缓存命中:0.25 元 / 百万 tokens
同一价格页面还显示,Hy3 preview 仍按输入长度分档计费。缓存命中价仅为输入价的四分之一,对多轮对话、长系统提示词、RAG 这类前缀复用率高的场景比较友好。
怎么部署
开发者可以通过腾讯云混元大模型、TokenHub 等云端服务接入 Hy3,也可以下载开源权重本地部署。Hugging Face 模型卡中给出了基于 vLLM 和 SGLang 的部署示例,并支持通过 OpenAI 兼容 API 方式调用。
需要注意的是,Hy3 总参数规模较大,官方建议在多卡高显存 GPU 环境中部署,生产环境可结合 FP8 版本与推理框架进行成本优化。这也是腾讯同时放出 Hy3-FP8 权重的原因——FP8 能把显存占用和推理成本压下来,代价是极少量精度损失。
常见问题
Hy3 和 Hy3 Preview 是同一个模型吗?
不是。Hy3 是正式版,基于 4 月发布的 Hy3 Preview 之后来自 50 多个产品团队的反馈继续优化,提升了后训练数据质量与多样性,并扩大了强化学习训练规模。
Hy3 的参数规模是多少?
采用 MoE 架构,总参数 295B、激活参数 21B,另有 3.8B MTP 层参数,支持 256K 上下文长度。
本地部署有什么硬件要求?
由于总参数规模较大,官方建议在多卡高显存 GPU 环境中部署,生产环境可结合 FP8 版本与 vLLM、SGLang 等推理框架做成本优化。
小结
Hy3 的正式版路线很清晰:不靠堆参数博眼球,而是把 295B/21B 的稀疏结构、256K 长上下文、可切换的三档思考模式和一个相当克制的 API 定价组合在一起,指向的是”能长期跑在生产环境里”的性价比模型。对于正在做国产开源模型选型的团队,它的价值更多体现在成本曲线而不是峰值跑分上——先按 no_think 跑通链路,再对关键环节升级推理档位,是更务实的用法。
