Qwen3.8-Omni-Flash发布:原生全模态Agent,29项基准涨25%,音视频API降幅超93%

阿里千问2026年9月18日发布新一代原生全模态模型 Qwen3.8-Omni-Flash。该模型具备文本、图像、音频和视频的联合理解能力,支持100万token超长上下文,并在29项评测中平均得分相比上一代 Qwen3.5-Omni-Plus 提升超过25%,同时音视频API价格降幅超过93%。它的核心目标是推动全模态模型从「理解内容」进一步走向「规划任务、调用工具并完成创作」,让Agent真正进入专业音视频生产流程。

全模态Agent能力:从看懂到执行

Qwen3.8-Omni-Flash 在编程、文本知识工作和 GUI 操作等通用 Agentic 能力基础上,进一步拓展了以音视频为核心的 Agentic 应用。该模型支持视频剪辑、音乐视频创作、影视制作与解说、音视频转图文摘要等综合工作流,在 WildClawBench-MM(多模态工具使用)上从34.5分提升至71.0分,增幅36.5分;在 AgenticVBench 上提升22.3分;在 UniClawBench 上取得69.6分。

一个典型案例是「12小时自主提升方言识别模型」实验:Qwen3.8-Omni-Flash 自主设定评测标准、构建训练数据并驱动迭代,最终将 Qwen2.5-Omni-3B 的四川话字符错误率从25.79%降至15.30%,相对下降约40.7%。这说明大模型已能参与模型研发本身,形成「通用模型负责研发、小模型面向业务」的新范式。

音视频理解:从被动感知到主动取证

面对数小时长视频,传统方法需要从头到尾处理全部内容,即使答案只存在于几分钟内。Qwen3.8-Omni-Flash 原生 Agent 从问题出发,自主决定该看什么、听什么,通过由粗到细的多轮取证定位关键信息,无需逐帧处理整部视频即可将计算与Token预算集中在真正相关的片段上。

OmniVideoBench 实验显示,Agentic 理解将准确率从63.4提升至67.8,同时每个查询 Token 消耗从145,736降至79,117,降幅约45.7%。在长会议场景中,模型可联合理解人物画面与语音内容,端到端完成说话人切分、内容转录与身份对应,并结合工具调用直接发送邮件、整理任务甚至开始编码。

API价格:音频降幅超98%,音视频降幅超93%

Qwen3.8-Omni-Flash 在性价比上实现了显著突破。API 每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%(按2分钟素材输入成本乘30估算,音视频采用720p、1fps)。

在基础能力方面,模型在 LongAudioSpan 提升8.3分,OmniVideoBench 提升9.6分,AliMeeting 的 DER/cpWER 从88.11/89.61降至3.35/17.18,整体音视频能力已接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash。

工具链:Qwen-MM-Plugins 与 Qwen-Live Harness

阿里同步开源了两套工具以释放 Qwen3.8-Omni-Flash 的全模态 Agent 能力。Qwen-MM-Plugins 提供长音视频按需感知、工具调用与工作流执行支持,包含 Video2Note(将数小时视频压缩为图文对应的 PDF 笔记)和 Omni Skill Creator(从操作演示中提炼 SOP 并转化为可复用的 Agent Skill)。Qwen-Live Harness 则面向实时、持续的全模态交互,支持音视频流输入同时完成感知与响应,是首个支持「听声辨位」的全模态大模型——融合空间声音与视觉信息,持续判断声源方向和距离,并同步感知障碍与通行区域。

Qwen3.8-Omni-Flash 性能对比

评测集 Qwen3.8-Omni-Flash Qwen3.5-Omni-Plus Gemini 3.8 Flash 说明
WildClawBench-MM 71.0 34.5 58.9 多模态工具使用,+36.5分
AgenticVBench 36.8 14.5 45.0 Agent视觉推理
UniClawBench 69.6 67.1 69.0 统一Agent基准
LongAudioSpan 提升 8.3 分(具体数值待官方披露)
OmniVideoBench 提升 9.6 分(具体数值待官方披露)
AliMeeting DER/cpWER 3.35 / 17.18 88.11 / 89.61 — 多说话人识别,↓98%

相关阅读

FAQ

Qwen3.8-Omni-Flash 与上一代最大区别是什么?
从「理解全模态内容」升级为「规划任务、调用工具并完成创作」。Agentic 能力大幅提升,在 WildClawBench-MM 上提升36.5分,并支持 Video2Note、Omni Skill Creator 等开箱即用的生产力工具。

音视频 API 价格降幅是否意味着效果打折?
不。音频输入价格降幅超过98%,音视频输入价格降幅超过93%,同时基础能力仍有提升——AliMeeting 多说话人识别 DER 从88.11降至3.35,降幅约98%,准确率反而大幅提高。

Qwen3.8-Omni-Flash 与 Gemini 3.8 Flash 相比如何?
在音视频能力上已接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash。但在 UniClawBench(69.6 vs 69.0)和部分维度上仍有竞争,整体属于同档竞品,各有侧重。