结论先行:腾讯混元团队开源了投机解码框架 AngelSpec,覆盖从 drafter 训练、架构设计到线上部署的完整链路。同时开源的还有 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。实测数据相当亮眼:DFly 在 4 至 64 并发下取得 SOTA,较自回归基线平均加速 1.98–2.40 倍,代码与数学场景峰值达到 2.86 倍;D-cut 在高并发下额外提升吞吐 15.7%;MTP 结合 TTT 将对话接受率从 52.8% 提升至 66.4%。
投机解码解决的是什么问题
大模型逐 token 生成的方式,本质上受限于显存带宽而非算力。每生成一个 token,都要把整个模型的权重从显存读进计算单元一次——这就是为什么「算得快」不等于「出字快」。
投机解码(Speculative Decoding)的思路很直观:先用一个小模型(drafter)快速猜出后面若干个 token,再让大模型一次性并行验证。猜对了,这几个 token 就等于一次前向传播全部产出;猜错了,从第一个错误处回退重来。只要接受率够高,整体速度就能显著提升,而输出分布与原始自回归采样保持一致——这一点很重要,它意味着加速不以牺牲质量为代价。
AngelSpec 的特别之处:全链路开源
市面上已有不少投机解码的实现,但多数只开源推理代码,drafter 的训练过程与权重往往缺失。而 drafter 恰恰是最难的部分——它需要与目标模型的输出分布高度对齐,否则接受率上不去,加速就退化成空转。
AngelSpec 明确覆盖了三个环节:
- drafter 训练:开源训练代码,让使用者可以针对自己的模型重新训练 drafter;
- 架构设计:提供 MTP 与 DFly 两种不同的 drafter 结构;
- 线上部署:给出可落地的部署方案,而不只是论文级实现。
同时开源的还有 Hy3-A21B 的 MTP 与 DFly drafter 权重。这意味着使用者不必从零训练,可以直接在混元模型上验证效果,也可以把这套权重作为继续训练的起点。
三组关键数据怎么读
| 指标 | 数值 | 含义 |
|---|---|---|
| DFly 平均加速 | 1.98–2.40 倍 | 4 至 64 并发区间,相对自回归基线,取得 SOTA |
| 代码 / 数学峰值加速 | 2.86 倍 | 结构化输出场景下 drafter 更易猜中,收益最高 |
| D-cut 吞吐增益 | +15.7% | 高并发下的额外优化,缓解验证阶段的开销 |
| 对话接受率(MTP + TTT) | 52.8% → 66.4% | 接受率是加速上限的决定性因素,提升约 13.6 个百分点 |
为什么代码与数学场景收益最高
2.86 倍的峰值出现在代码与数学任务上,这不是巧合。代码有强烈的语法结构与惯用模式,数学推导也高度模板化,drafter 更容易预测到后续 token。反过来,开放式闲聊的可预测性最差,接受率天然偏低。
这也解释了为什么官方要专门报告「对话接受率」这一项——对话是最难的场景,把它的接受率从 52.8% 提到 66.4%,难度远高于在代码场景刷出高倍数。
MTP 与 TTT 的组合
MTP(Multi-Token Prediction,多 token 预测)让模型一次预测多个后续 token;TTT(Test-Time Training,测试时训练)则允许 drafter 在实际运行阶段根据当前上下文继续自我调整。两者结合,本质上是让 drafter 在推理过程中持续贴合目标分布,从而把接受率推高。66.4% 的对话接受率,正是这套组合的结果。
D-cut 与高并发场景
投机解码有一个容易被忽略的瓶颈:并发升高时,验证阶段本身会变成新的开销来源——大批量的候选 token 需要目标模型做前向计算,如果验证成本过高,加速收益会被吃掉。D-cut 针对的正是这个问题,在高并发下额外带来 15.7% 的吞吐提升。对线上服务而言,这个数字可能比峰值加速更有意义,因为生产环境几乎总是在高并发下运行。
谁应该关注这个框架
自建推理服务的团队
如果你自己部署大模型服务,推理成本是大头。平均 2 倍左右的加速意味着同样的硬件可以服务更多请求,或者同样的请求量可以少采购一批卡。这是最直接的商业价值。
做端侧或小规模部署的团队
小 drafter + 大模型的组合让资源受限环境下的高质量输出成为可能。1B 级别的 drafter 在端侧设备上运行的门槛远低于完整大模型。
研究推理优化方向的开发者
完整开源训练代码与权重,意味着可以直接在其基础上做改进实验,而不必复现整条流程。
常见问题
投机解码会影响输出质量吗?
理论上不会。投机解码的验证机制保证了最终输出分布与原始自回归采样一致,猜错的 token 会被回退重采样。这也是它相比剪枝、量化等有损加速方案的核心优势。
接受率高低由什么决定?
主要取决于 drafter 与目标模型的分布对齐程度,以及任务本身的可预测性。代码、数学等结构化任务接受率天然较高,开放式对话较低。AngelSpec 通过 MTP 结合 TTT 把对话接受率从 52.8% 提升到 66.4%。
开源了哪些内容?
框架覆盖 drafter 训练、架构设计到线上部署全链路,并同步开源 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。
小结
AngelSpec 的意义不只是「又一套投机解码实现」,而是把最难复现的那一环——drafter 的训练——完整开放了出来。1.98–2.40 倍的平均加速证明了方案的可靠性,代码数学场景 2.86 倍峰值展示了上限,而对话接受率从 52.8% 提到 66.4% 则说明它在最难的场景里也站得住。加上 D-cut 对高并发的针对性优化,这套框架已经具备了直接进入生产环境的完成度。对任何正在为推理成本发愁的团队,它都值得一试。
