2026 年 8 月 26 日,阿里通义千问团队正式发布全新多模态 MoE 模型 Qwen3.8-Flash:主模型参数量 125B,额外配备 51B N-gram Embedding,每 Token 仅激活 6B 参数,原生支持 262,144 Tokens 上下文,可通过 YaRN 扩展至 100 万 Tokens。API 输入价格低至每百万 Tokens 1 元。
架构升级:四个方向的效率革命
Qwen3.8-Flash 围绕 Attention、Residual、Embedding 和 Optimization 四个方向重构架构:
- 混合注意力:Gated DeltaNet 负责压缩和保留历史信息,Qwen Sparse Attention 在 Micro-block 粒度筛选重要上下文,显著降低长序列的注意力与索引开销
- Gated Residual:将传统单一残差流扩展为 4 条并行分支,动态门控改善跨层信息传递和训练稳定性
- 51B N-gram Embedding:以较低计算成本扩展模型容量,并可卸载至 Host Memory
- Muon Optimizer:针对新架构重新拟合 Scaling Law
性能数据
| 指标 | 成绩 |
|---|---|
| QSA Attention Kernel Prefill 加速(100 万 Token 上下文) | 最高 7.6 倍 |
| QSA Attention Kernel Decode 加速 | 最高 4.9 倍 |
| Prefill 吞吐(90% 前缀缓存命中率) | Qwen3.7-Plus 的 8.6 倍 |
| 训练开销 | 约为 Qwen3.7-Plus 的 1/9 |
在训练成本大幅降低的同时,Qwen3.8-Flash 在 AI 编程、办公任务和智能体场景中的表现反而超过 Qwen3.7-Plus。
价格与获取
- API 价格:输入每百万 Tokens 1 元、输出 3 元
- 生产版本:默认提供 100 万 Token 上下文和官方内置工具
- 千问办公:Qwen3.8-Flash 已首发接入,服务文档、表格、演示文稿和专业研究等场景
彩蛋:Qwen3.8-Flash-Next 权重开放
千问团队同步开放了 Qwen3.8-Flash-Next 模型权重,这是下一代 Qwen4 架构的实验性预览,开发者可通过 Hugging Face 和 ModelScope 下载自行部署。官方表示,提前开放权重是为了让社区测试验证新架构,为完整的 Qwen4 模型家族做准备。
常见问题(FAQ)
Qwen3.8-Flash 开源吗?
Qwen3.8-Flash 本体通过千问 AI 平台提供 API 服务;实验性的 Qwen3.8-Flash-Next 权重已开放下载,可视为 Qwen4 的预览版。
和 Qwen3.8-Max 有什么区别?
Max 是 2.4 万亿参数的旗舰模型,追求最强性能;Flash 是 125B 主参数的高效模型,追求极致性价比,API 价格低了两个数量级。
上下文窗口有多大?
原生 262,144 Tokens,通过 YaRN 可扩展至 100 万 Tokens,生产版本默认开放 100 万上下文。
小结
Qwen3.8-Flash 证明了「更省的架构 + 更强的效果」可以同时成立:训练成本压到 1/9、激活参数仅 6B,编程和 Agent 能力却不降反升。对于成本敏感的高频调用场景(办公自动化、Agent 工作流),这是目前性价比极高的选择之一。
消息来源:aihub.cn 资讯、通义千问官方。
相关阅读
这条线上还有几篇站内文章可以接着看:
