阿里千问2026年9月18日发布新一代原生全模态模型 Qwen3.8-Omni-Flash。该模型具备文本、图像、音频和视频的联合理解能力,支持100万token超长上下文,并在29项评测中平均得分相比上一代 Qwen3.5-Omni-Plus 提升超过25%,同时音视频API价格降幅超过93%。它的核心目标是推动全模态模型从「理解内容」进一步走向「规划任务、调用工具并完成创作」,让Agent真正进入专业音视频生产流程。
全模态Agent能力:从看懂到执行
Qwen3.8-Omni-Flash 在编程、文本知识工作和 GUI 操作等通用 Agentic 能力基础上,进一步拓展了以音视频为核心的 Agentic 应用。该模型支持视频剪辑、音乐视频创作、影视制作与解说、音视频转图文摘要等综合工作流,在 WildClawBench-MM(多模态工具使用)上从34.5分提升至71.0分,增幅36.5分;在 AgenticVBench 上提升22.3分;在 UniClawBench 上取得69.6分。
一个典型案例是「12小时自主提升方言识别模型」实验:Qwen3.8-Omni-Flash 自主设定评测标准、构建训练数据并驱动迭代,最终将 Qwen2.5-Omni-3B 的四川话字符错误率从25.79%降至15.30%,相对下降约40.7%。这说明大模型已能参与模型研发本身,形成「通用模型负责研发、小模型面向业务」的新范式。
音视频理解:从被动感知到主动取证
面对数小时长视频,传统方法需要从头到尾处理全部内容,即使答案只存在于几分钟内。Qwen3.8-Omni-Flash 原生 Agent 从问题出发,自主决定该看什么、听什么,通过由粗到细的多轮取证定位关键信息,无需逐帧处理整部视频即可将计算与Token预算集中在真正相关的片段上。
OmniVideoBench 实验显示,Agentic 理解将准确率从63.4提升至67.8,同时每个查询 Token 消耗从145,736降至79,117,降幅约45.7%。在长会议场景中,模型可联合理解人物画面与语音内容,端到端完成说话人切分、内容转录与身份对应,并结合工具调用直接发送邮件、整理任务甚至开始编码。
API价格:音频降幅超98%,音视频降幅超93%
Qwen3.8-Omni-Flash 在性价比上实现了显著突破。API 每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%(按2分钟素材输入成本乘30估算,音视频采用720p、1fps)。
在基础能力方面,模型在 LongAudioSpan 提升8.3分,OmniVideoBench 提升9.6分,AliMeeting 的 DER/cpWER 从88.11/89.61降至3.35/17.18,整体音视频能力已接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash。
工具链:Qwen-MM-Plugins 与 Qwen-Live Harness
阿里同步开源了两套工具以释放 Qwen3.8-Omni-Flash 的全模态 Agent 能力。Qwen-MM-Plugins 提供长音视频按需感知、工具调用与工作流执行支持,包含 Video2Note(将数小时视频压缩为图文对应的 PDF 笔记)和 Omni Skill Creator(从操作演示中提炼 SOP 并转化为可复用的 Agent Skill)。Qwen-Live Harness 则面向实时、持续的全模态交互,支持音视频流输入同时完成感知与响应,是首个支持「听声辨位」的全模态大模型——融合空间声音与视觉信息,持续判断声源方向和距离,并同步感知障碍与通行区域。
Qwen3.8-Omni-Flash 性能对比
| 评测集 | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash | 说明 |
|---|---|---|---|---|
| WildClawBench-MM | 71.0 | 34.5 | 58.9 | 多模态工具使用,+36.5分 |
| AgenticVBench | 36.8 | 14.5 | 45.0 | Agent视觉推理 |
| UniClawBench | 69.6 | 67.1 | 69.0 | 统一Agent基准 |
| LongAudioSpan | 提升 8.3 分(具体数值待官方披露) | |||
| OmniVideoBench | 提升 9.6 分(具体数值待官方披露) | |||
| AliMeeting DER/cpWER | 3.35 / 17.18 | 88.11 / 89.61 | — | 多说话人识别,↓98% |
相关阅读
- MiniMax H3发布:打破任务边界的全模态生成模型,2K视频价格不到主流1/3
- Qwen-Drive-1.0:首个统一3D感知与运动规划的自动驾驶视觉-语言模型
- 谷歌发布Gemini 4 Argon:77.9%登顶SWE-bench,输入$2/M
FAQ
Qwen3.8-Omni-Flash 与上一代最大区别是什么?
从「理解全模态内容」升级为「规划任务、调用工具并完成创作」。Agentic 能力大幅提升,在 WildClawBench-MM 上提升36.5分,并支持 Video2Note、Omni Skill Creator 等开箱即用的生产力工具。
音视频 API 价格降幅是否意味着效果打折?
不。音频输入价格降幅超过98%,音视频输入价格降幅超过93%,同时基础能力仍有提升——AliMeeting 多说话人识别 DER 从88.11降至3.35,降幅约98%,准确率反而大幅提高。
Qwen3.8-Omni-Flash 与 Gemini 3.8 Flash 相比如何?
在音视频能力上已接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash。但在 UniClawBench(69.6 vs 69.0)和部分维度上仍有竞争,整体属于同档竞品,各有侧重。
延伸阅读
- 阶跃星辰 600B MoE 旗舰 Step 5 Preview 上线 22 小时 GPU Kernel 优化到 508 TFLOPS2 周前
- ChatGPT Agent正式发布:虚拟浏览器自主完成表格/幻灯片/调研,Pro/Plus/Team用户如何开启3 周前
- 千问办公 QwenWork 正式上线:一站式 AI Agent 平台深度绑定钉钉,标准版 78 元/月起3 周前
- n8n 工作流自动化突破 204793 Star:400 多个集成撑起自托管 AI 自动化的护城河3 周前
