Qwen4 投入训练:10万亿参数路线图,零干预迭代33轮

9 月 22 日开幕的 2026 云栖大会上,阿里把大模型的下一步摊到了台面上。Qwen4 已经投入训练,Qwen4.5 与 Qwen5 的参数规模被规划到 5 万亿至 10 万亿,是当前旗舰 Qwen3.8-Max 约 2.4 万亿参数的两到四倍。真正让我停下来的其实是另一件事,Qwen3.8-Max 在人类不介入的前提下自己迭代了一个多月,完成 33 轮有效迭代。

参数路线走到哪一步了

先看规模。阿里巴巴 CEO 吴泳铭在大会上确认,公司准备训练参数量在 5 万亿到 10 万亿之间的新一代模型,这是它迄今最激进的一次 AI 计划。Qwen LLM 项目负责人刘大一恒给出的判断是,Scaling 依然是迈向 ASI 的重要路径。这位负责人是在云栖大会前不久才接掌产品线的,人事背景我整理在 阿里 Qwen 团队换帅这篇里。

模型 参数规模 当前状态
Qwen3.8-Max 约 2.4 万亿 现有旗舰,已上线
Qwen4 未披露 已投入训练,基于下一代架构
Qwen4.5 / Qwen5 5 万亿至 10 万亿 规划阶段

目标又不只是堆参数。刘大一恒把重点放在架构创新和数据优化上,希望未来的模型能啃下更复杂、时间跨度更长的任务。这话听着抽象,落到评测上就是 Agentic 智能体和长程任务的得分。

RSI 已经落到训练、推理和芯片协同环节

这次披露里分量最重的是这一段。Qwen3.8-Max 已经能够自主搭建训练流程、构造数据、设计实验并定位缺陷,在人类零参与的情况下持续迭代超过一个月,完成 33 轮有效迭代,让 Artificial Analysis 的得分提升了 12.5%。同期它在 Artificial Analysis Agentic 智能体评测、CodeArena 前端编程评测里也处在前列。

12.5% 这个幅度谈不上惊人,我更看重它的性质。闭环跑通意味着模型开始参与提升自己的过程,而且这一段不再需要人逐轮下指令。阿里同时表示,递归自我改进已经落到了模型训练、推理以及芯片协同设计等环节。

需要说清楚的是,全自主的 RSI 还没有真正发生,阿里和 OpenAI 两边的表述都保留了这句限定。把 12.5% 当成起点,比当成结论稳妥得多。

多模态矩阵与开源数据

效率侧的改动来自 Qwen3.8-Flash 的训练成本优化,它通过注意力机制等创新把训练成本降低接近 90%,并用更少的激活参数换推理效率。这条线对最终 API 定价的影响,比发布会上的口号实在。

多模态这边排得很满。Qwen3.8-Omni-Flash 全模态模型统一处理视频、音频、图片与文字;Wan3.0 支持单次生成 30 秒视频并接受结构化输入,下一代视频模型会在 11 月发布;Qwen-Audio-3.1 系列覆盖 ASR、TTS 与 Realtime,Qwen3.8-LiveTranslate 把字均延迟压到 2.3 秒。图像线则是 Qwen-Image-3.1、Qwen-Image-2.1 开源模型、HappyShrimp 1.1 与 HappyOyster 2.0-Preview 同步推进。

指标 数值
Qwen3.8 系列近一个月下载量 超过 5600 万次
Qwen3.8 衍生模型数 超过 1900 个
阿里累计开源千问模型 超过 460 个
千问模型累计下载量 超过 30 亿次
累计衍生模型数 超过 30 万个

阿里还提到 Perplexity、Airbnb、Pinterest 与路透社等公司已在用 Qwen 做 Agent、AI 助手或自研模型。这一组名字的意义在于商业化路径被验证过了,不至于出现开源生态热闹但没人买单的局面。

芯片和数据中心跟得上吗

训练 10 万亿参数的东西,算力必须给说法。这次配套的是平头哥半导体研发的 真武V900 芯片,算力是上一代 M890 的三倍,基于它构建的单一 AI 集群最多支持 50 万张加速卡协同,预计 2027 年第一季度量产并商业化。

数据中心这边,阿里计划到 2032 年把全球数据中心总容量提升到 20 吉瓦以上。吴泳铭没有只讲好消息,他也直言全球产业链卡在设备、电力和基础设施供应上,扩张速度因此受限。这句中长期需求增速仍超过供应的判断,我认同。

FAQ

Qwen4 什么时候能用上

目前只有已投入训练这一句,没有时间表。参考 Qwen3.8 系列此前的节奏,从训练跑到开放 API 通常要好几个月,我倾向把它当成明年的事情,具体节点还得等官方。

10 万亿参数意味着什么

最直观的是成本。参数涨到四倍,训练算力、内存带宽和集群规模都不是线性增长能解决的,这也是 V900 和几十万卡级别的集群必须同时落地的原因。另一个层面是能力边界能不能真的跨越长程任务,得看真实评测而不是参数本身。

普通用户能感知到什么

短期最实在的是价格和延迟。训练成本降低这类改动最终会体现到 API 定价上,Wan3.0 与 Qwen-Audio-3.1 则会直接影响视频生成和语音交互的体验。10 万亿参数这个数字,用户大概率感受不到。

小结

云栖大会这场发布可以拆成三条线,模型侧押下一代架构和 10 万亿参数,方法侧把 RSI 从概念推进到训练环节,硬件侧配 V900 与 20 吉瓦数据中心规划。三条线互相绑死,缺任何一条另外两条都跑不动。我自己会盯 11 月的下一代视频模型,那大概是新架构第一次公开的产品级验证。


相关阅读

阿里真武V900 发布解析

Qwen3.8-Flash 低成本预训练

Qwen3.8-Omni-Flash 全模态上线

Qwen-Image-2.1 开源

阿里 Qwen 团队换帅