腾讯混元开源投机解码框架 AngelSpec:DFly 平均加速 1.98–2.40 倍,代码数学峰值 2.86 倍

结论先行:腾讯混元团队开源了投机解码框架 AngelSpec,覆盖从 drafter 训练、架构设计到线上部署的完整链路。同时开源的还有 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。实测数据相当亮眼:DFly 在 4 至 64 并发下取得 SOTA,较自回归基线平均加速 1.98–2.40 倍,代码与数学场景峰值达到 2.86 倍;D-cut 在高并发下额外提升吞吐 15.7%;MTP 结合 TTT 将对话接受率从 52.8% 提升至 66.4%。

投机解码解决的是什么问题

大模型逐 token 生成的方式,本质上受限于显存带宽而非算力。每生成一个 token,都要把整个模型的权重从显存读进计算单元一次——这就是为什么「算得快」不等于「出字快」。

投机解码(Speculative Decoding)的思路很直观:先用一个小模型(drafter)快速猜出后面若干个 token,再让大模型一次性并行验证。猜对了,这几个 token 就等于一次前向传播全部产出;猜错了,从第一个错误处回退重来。只要接受率够高,整体速度就能显著提升,而输出分布与原始自回归采样保持一致——这一点很重要,它意味着加速不以牺牲质量为代价。

AngelSpec 的特别之处:全链路开源

市面上已有不少投机解码的实现,但多数只开源推理代码,drafter 的训练过程与权重往往缺失。而 drafter 恰恰是最难的部分——它需要与目标模型的输出分布高度对齐,否则接受率上不去,加速就退化成空转。

AngelSpec 明确覆盖了三个环节:

  • drafter 训练:开源训练代码,让使用者可以针对自己的模型重新训练 drafter;
  • 架构设计:提供 MTP 与 DFly 两种不同的 drafter 结构;
  • 线上部署:给出可落地的部署方案,而不只是论文级实现。

同时开源的还有 Hy3-A21B 的 MTP 与 DFly drafter 权重。这意味着使用者不必从零训练,可以直接在混元模型上验证效果,也可以把这套权重作为继续训练的起点。

三组关键数据怎么读

指标 数值 含义
DFly 平均加速 1.98–2.40 倍 4 至 64 并发区间,相对自回归基线,取得 SOTA
代码 / 数学峰值加速 2.86 倍 结构化输出场景下 drafter 更易猜中,收益最高
D-cut 吞吐增益 +15.7% 高并发下的额外优化,缓解验证阶段的开销
对话接受率(MTP + TTT) 52.8% → 66.4% 接受率是加速上限的决定性因素,提升约 13.6 个百分点

为什么代码与数学场景收益最高

2.86 倍的峰值出现在代码与数学任务上,这不是巧合。代码有强烈的语法结构与惯用模式,数学推导也高度模板化,drafter 更容易预测到后续 token。反过来,开放式闲聊的可预测性最差,接受率天然偏低。

这也解释了为什么官方要专门报告「对话接受率」这一项——对话是最难的场景,把它的接受率从 52.8% 提到 66.4%,难度远高于在代码场景刷出高倍数。

MTP 与 TTT 的组合

MTP(Multi-Token Prediction,多 token 预测)让模型一次预测多个后续 token;TTT(Test-Time Training,测试时训练)则允许 drafter 在实际运行阶段根据当前上下文继续自我调整。两者结合,本质上是让 drafter 在推理过程中持续贴合目标分布,从而把接受率推高。66.4% 的对话接受率,正是这套组合的结果。

D-cut 与高并发场景

投机解码有一个容易被忽略的瓶颈:并发升高时,验证阶段本身会变成新的开销来源——大批量的候选 token 需要目标模型做前向计算,如果验证成本过高,加速收益会被吃掉。D-cut 针对的正是这个问题,在高并发下额外带来 15.7% 的吞吐提升。对线上服务而言,这个数字可能比峰值加速更有意义,因为生产环境几乎总是在高并发下运行。

谁应该关注这个框架

自建推理服务的团队

如果你自己部署大模型服务,推理成本是大头。平均 2 倍左右的加速意味着同样的硬件可以服务更多请求,或者同样的请求量可以少采购一批卡。这是最直接的商业价值。

做端侧或小规模部署的团队

小 drafter + 大模型的组合让资源受限环境下的高质量输出成为可能。1B 级别的 drafter 在端侧设备上运行的门槛远低于完整大模型。

研究推理优化方向的开发者

完整开源训练代码与权重,意味着可以直接在其基础上做改进实验,而不必复现整条流程。

常见问题

投机解码会影响输出质量吗?

理论上不会。投机解码的验证机制保证了最终输出分布与原始自回归采样一致,猜错的 token 会被回退重采样。这也是它相比剪枝、量化等有损加速方案的核心优势。

接受率高低由什么决定?

主要取决于 drafter 与目标模型的分布对齐程度,以及任务本身的可预测性。代码、数学等结构化任务接受率天然较高,开放式对话较低。AngelSpec 通过 MTP 结合 TTT 把对话接受率从 52.8% 提升到 66.4%。

开源了哪些内容?

框架覆盖 drafter 训练、架构设计到线上部署全链路,并同步开源 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。

小结

AngelSpec 的意义不只是「又一套投机解码实现」,而是把最难复现的那一环——drafter 的训练——完整开放了出来。1.98–2.40 倍的平均加速证明了方案的可靠性,代码数学场景 2.86 倍峰值展示了上限,而对话接受率从 52.8% 提到 66.4% 则说明它在最难的场景里也站得住。加上 D-cut 对高并发的针对性优化,这套框架已经具备了直接进入生产环境的完成度。对任何正在为推理成本发愁的团队,它都值得一试。