8 月 13 日早上,阿里千问大模型团队把 Qwen3.8-2.4T-A95B 的模型权重挂上了 Hugging Face 和魔搭社区。十天前 Qwen3.8-Max 发布时承诺的开放权重,说到做到了。这也是千问家族第一次把 Max 级别的旗舰模型对外公开权重。
Qwen3.8-Max 就是基于 Qwen3.8-2.4T-A95B 的官方版本,8 月 3 日发布,带视觉输入、免思考模式、默认百万级上下文和内置官方工具。这次开放的是底层模型权重,两者共用一套架构。总参数 2.4 万亿,每个 Token 激活 950 亿参数,原生支持 262144 Token 上下文,可以扩展到 101 万。底层沿用 Qwen3.5 的架构,重点打磨编程、办公、科研和长周期智能体任务。
基准测试里有几项很亮眼。论文复现基准 PaperBench 拿到 93.0 分,高于 GPT-5.6 Sol、Fable 5 和 Claude Opus 4.8。评估电脑操作能力的 OSWorld-Verified 以 86.1 分排在第一,参数化 CAD 基准 91.5 分同样超过 Fable 5。不过它没有全面登顶,TerminalBench 2.1 的 86.6 分低于 GPT-5.6 Sol 的 88.8,SWE-bench Pro 的 67.7 分也落后于 Fable 5 的 80.0。
开源社区的反应来得很快。Unsloth AI 用动态 1-bit 分层选择性量化技术,把原始 4.9TB 的模型体积压到 397GB,存储缩减 91%。配合 Unsloth-Desktop 工具,设备内存加显存总量超过 410GB 就能本地跑起来。对一个 2.4 万亿参数的模型来说,这个门槛已经低得超出预期。
部署路径也铺好了,SGLang、vLLM 和 TokenSpeed 推理引擎都支持,正式部署需要用各框架针对 Qwen3.8 的最新 Recipe 并选择并行策略。模型默认以思考模式运行,生成最终回答前会先输出思考内容,且不支持关闭。更小杯的 Qwen3.8-27B 权重也在路上了,魔搭社区已经预告。
价格方面,Qwen3.8-Max 国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中 1.5 元。海外每百万 Tokens 输入 2 美元、输出 6 美元,隐式缓存命中 0.25 美元。这和 Grok 4.6 的海外定价恰好站在同一档。
回头看这 24 小时,三家顶流轮番炸场。先是马斯克的 Grok 4.6,接着 DeepSeek V4 Pro 正式版上线,最后阿里把 2.4 万亿参数的旗舰权重彻底放开。三家的动作指向同一个方向,都在强化多步骤长周期自主工作能力,比拼模型独立承接完整项目的水平。
对中国开源生态来说,这一步的分量在于,以往 Max 级别的千问旗舰从不公开权重,这次是第一次。Hugging Face 上那串数字还在增长,下载量计数的跳动速度,大概就是开发者对这个决定最直接的投票。
