8月3日,阿里云千问团队正式发布了 Qwen 家族迄今最强大的模型 Qwen3.8-Max,并宣布了一个重磅决定:下周开源模型权重,同时开源的还有 Qwen3.8-27B。这是 Qwen-Max 级别模型历史上第一次向社会开放权重,意味着阿里把自家旗舰级大模型的”底牌”直接摆上了桌——在这个各家闭源旗舰动辄数千亿美元估值的时代,这一动作的分量不言而喻。
2.4 万亿参数:千问首次摸到万亿级天花板
Qwen3.8-Max 基于 Qwen 3.5 的架构基础构建,总参数量达到 2.4 万亿(激活参数 95B),是千问系列中尺寸最大、性能最强的旗舰模型。它采用了稀疏 MoE 架构与混合注意力机制的联合优化,在把总参数量推上 2.4T 的同时保持了更高的推理效率和更快的推理速度,支持 100 万 token 的超长上下文,并原生支持视觉理解——文本、图像、视频都能作为输入。官方表示,模型在编程、办公、科研以及长周期任务等维度实现了全面提升,不仅能回答更具挑战性的问题,还能更可靠地端到端完成复杂任务,输出值得信赖的成果。
自主编程:16 天无人干预,从空文件夹到完整开源项目
这次发布最震撼的实测来自自主编程。在自动化编程测试中,Qwen3.8-Max 在无人工干预的情况下独立运行了约 16 天,从一个空文件夹出发,自主搭建循环工程(Loop Engineering)框架,编排智能体自动领取和执行任务,最终做出一个 Hermes Agent 级别的、真实可用的自进化智能体框架”oh-my-cli”,在 GitHub 上累计完成 265 次代码提交、127 个合并请求和 151 个问题单的闭环处理,整个项目现已完全开源。人类工程师甚至可以通过钉钉随时给模型提出新需求。在两年前,前沿模型还停留在”写好函数、补全代码”的阶段,如今 Qwen3.8-Max 已经能独自交付一个持续十数天的真实软件工程项目。在权威的 CodeArena 编程榜单上,Qwen3.8-Max 位居全球第四;在 PaperBench 等编程智能体评测中,它较上代模型大幅提升 28.2 分,以 93.0 分录得评测新高。
科研复现:125 小时自主工作,还能自我进化
科研场景同样展示了长周期任务的实力。阿里让 Qwen3.8-Max 尝试重现一篇大型语言模型推理研究论文:模型连续工作约 125 小时,前 37 小时从零建立训练与评测流程,成功复现论文的 6 项主要结论;随后它自行提出并测试了 18 项改进方向,最终在数学基准 AIME24 上较原方法提高了 2.7 分。这种”复现-改进-再验证”的闭环能力,已经超越了单纯的问答或写代码,进入了自主科研探索的范畴。此外,模型还在阿里云天池平台的 WWW2025 多模态对话意图识别挑战赛中,于 24 小时内击败了 458 支人类参赛队伍。
专业办公(Cowork):一小时的活,几十分钟干完
面向真实职业场景,Qwen3.8-Max 通过真实环境和算力联合的强化学习(RL)扩展,实现了数百种高价值、高频专业任务的真实表现提升。实测数据相当直观:一支法务助理团队在数百份法律文档中标注千余条相关条款需要一周时间,Qwen3.8-Max 一小时内就能完成——官方称它能在数百份文件中找出 1284 项相关条款;一个篮球数据分析团队逐帧标注 160 小时以上的比赛录像,模型数十分钟就能精准拆解 8400 多个攻防回合,并一次性输出球员战术画像和教练报告;在量化投资领域,它自主调度约 330 个子智能体并行工作,连续数小时完成约 6000 次因子回测,交付完整的 ETF 轮动策略并持续分析修正。在芯片设计沙箱内,模型历经约 500 轮交互,将硬件门数从 8298 门精简至 678 门。在 365 天长周期电商经营模拟基准 E-Commerce Bench 中,Qwen3.8-Max 用 10 万元人民币启动资金完成选品、供应链议价、库存、定价与退货的全流程经营,最终持有现金约 41.6 万元(4.16 倍回报),较排名第二的 GLM 5.2 高出 38%。
多模态 Agent:视觉变成反馈回路,而非单纯输入
Qwen3.8-Max 强调的多模态能力与以往不同——视觉不再只是输入,而是作为操作过程中的反馈回路。模型可以处理超过 200 页的财报、百小时级别的视频、图片、文档及界面操作,并执行视频剪辑、3D 建模、网页还原与应用开发等任务;在操作过程中,它能持续观察成果,发现界面错位或物体方向错误后自行修正。在评估智能体电脑操作能力的 OSWorld-Verified 评测中,Qwen3.8-Max 以 86.1 分位居主流模型首位;在视觉推理 BabyVision 评测中,无工具条件下拿到 82.0 分,超出部分主流模型近两倍。阿里还同步推出了面向多模态 Agent 的扩展库 Qwen-MM-Plugins,推动多模态智能体向复杂任务的端到端执行迈进。
榜单与定价:Arena 仅次于 Claude,价格只有 Opus 5 的四成
8月3日放榜的权威三方榜单 Arena 显示,阿里 Qwen 模型整体性能仅次于 Anthropic 的 Claude 系列,位居全球大模型第一梯队。定价方面,全球开发者即日起可通过千问 AI 平台使用 Qwen3.8 的 API 服务:国内每百万 token 输入 12 元、输出 36 元,隐式缓存命中仅 1.5 元;海外输入、输出分别为 2 美元和 6 美元,隐式缓存命中 0.25 美元。作为对比,其国际输入与输出价格仅为 Anthropic Opus 5 的 40% 与 24%,实现了相近智能下的更高性价比。模型支持 OpenAI Chat Completions 与 Anthropic API 两种协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code 甚至 OpenClaw 等主流智能体框架,并提供 reasoning_effort 参数(xhigh/medium/low)调节推理深度与成本。API 目前已上线千问 AI 平台与 Vercel AI Gateway,并接入阿里同日推出的智能体产品”千问办公”。
开源的意义:吴泳铭那句”大模型是下一代操作系统”
社区对这次开源动作的反应相当热烈。有评论指出,阿里 CEO 吴泳铭曾说过”大模型是下一代操作系统”——把旗舰级权重放出来,才真像在做操作系统。下周权重将登陆 Hugging Face 与 ModelScope,届时自托管社区将迎来一个 2.4T 参数的开放选项,在智能体编程等场景上直接对标各家闭源旗舰。对于整个开源生态来说,这可能是继 DeepSeek 之后,中国大模型又一次改变游戏规则的动作。