千问 Qwen3.8-Omni-Flash 全模态上线:音频输入降价 98%,1M 上下文与评测提升 26%

阿里千问上线全模态模型 Qwen3.8-Omni-Flash,把音频输入的调用成本压到原来的约 2%(降幅超过 98%),同时把上下文窗口拉到 1M(100 万 Token),并在 30 项公开评测上取得平均超过 26% 的提升。三个数字指向同一件事:小时级的音视频素材,第一次在成本上具备了「整段喂进去」的可行性。

一、全模态(Omni)到底多了什么

所谓全模态(Omni),指的是同一套模型权重同时接受文本、图像、音频与视频四种输入,而不必为每种模态各接一个模型、再由业务侧自己做结果拼接。过去处理一段会议录像,标准做法是先做语音转写,再把文本交给语言模型,语气、停顿、画面里的白板与手势信息在这一步几乎全部丢失。全模态方案把这些信号留在同一个上下文里做联合推理,更接近人「边看边听」的理解方式。

1. 四类输入可以自由组合

文本和图像属于静态输入,音频和视频则带时间维度。Qwen3.8-Omni-Flash 支持这四类任意组合,开发者可以用「一段视频加一句文字指令」直接提问,也可以把图片和语音一起提交来描述需求。对客服质检、课堂分析、内容审核这类任务来说,省掉的是整条预处理流水线,以及流水线本身引入的误差。

2. Flash 这个后缀代表什么

Flash 通常指同一代产品里更看重吞吐与单位成本的一档。它的目标不是在所有基准上拿最高分,而是让高并发、长时间的调用算得过来账。因此它更适合被放进批量处理管线,而不是单次精益求精的创作型任务。如果你的场景对质量上限极度敏感,Flash 档未必是最终选择。

二、三个关键数字,分别改变了什么

维度 数值 对开发者的直接影响
上下文长度 1M(100 万 Token) 小时级素材可整段输入,免去切片与二次合并
评测表现 30 项平均提升超 26% 属于代际跃迁,而非单点优化
音频输入价格 降幅超 98%,约为原价 2% 长录音分析从「烧钱」变成可常态化运行

数据来源:以上三项均出自千问官方发布口径,经 AIbase 报道转述。

三、1M 上下文对音视频工作流的实际意义

1M 的实用价值要换算成时间才直观。一路中等码率的音频,一分钟大致消耗几百到上千 Token,按这个量级估算,100 万 Token 大约对应小时级的单条素材。过去处理两小时的访谈,工程上必须先切段、分别摘要、再做二次合并,切片边界处经常丢失上下文,前后指代也对不上。长上下文让「一次调用读完整段」成为可能,代价是单次请求的延迟与费用同步上升,需要按具体任务权衡。

1. 更适合长程任务的三类场景

会议纪要与决策追溯、课程录像的结构化拆解、长时段监控画面的异常定位,都属于典型长程任务。它们的共同点是结论依赖跨时段的信息关联,单帧画面或单句语音都回答不了,而这类任务恰恰是过去切片方案最容易失手的地方。

2. 什么时候切片仍然更划算

如果只需要从一段录音里提取五分钟的关键发言,切片照样更便宜。长上下文不是万能替代品,它解决的是「关键信息分散在整段素材里」这一类问题,而不是所有音视频任务。把两者混为一谈,只会得到一个更贵的方案。

四、什么时候该迁移,什么时候再观望

判断标准其实很朴素:把现有方案的月度账单拆开,看音频输入占多大比例。如果这个比例超过三成,98% 的降幅会立刻反映在账单上,值得优先迁移;如果成本大头落在输出 Token 或自建 GPU 上,切换的直接收益就没那么明显。另有一条独立判断线:如果业务强依赖多模态联合推理,比如需要结合画面判断说话人情绪,那么全模态带来的效果收益会高于纯价格因素,即便账单变化不大也值得试用。

FAQ:关于 Qwen3.8-Omni-Flash 你最可能关心的三个问题

Qwen3.8-Omni-Flash 支持哪些输入形式?

支持文本、图像、音频与视频四种输入,且可以任意组合提交,例如视频配文字指令、图片配语音说明。这让音视频类任务不必再先转写成文字才能交给模型处理。

音频输入降价 98% 之后,长音频处理就便宜了吗?

音频输入这一项的成本确实几乎可以忽略,但一次调用的总成本还包括文本输入与输出部分。是否划算要看完整账单结构:音频占比越高,降价的体感越明显;若成本主要在输出侧,收益则相对有限。

1M 上下文能直接塞进两小时的视频吗?

取决于视频的码率、抽帧密度与编码方式,不同配置下 Token 消耗差异很大。稳妥做法是先拿真实素材做一次小样本实测,确认单条能否容纳,再决定是否仍需要分段策略。

小结

Qwen3.8-Omni-Flash 的价值不在某一个单项指标,而在于把「能同时看懂多种输入」和「用得起」这两件事一起做到了。1M 上下文解决长程素材的完整性,98% 的音频降价解决经济性,30 项评测平均提升超过 26% 则保证它不是靠牺牲能力换低价。对音视频密集型业务,这是值得立刻做一次实测的型号;对以文本为主的业务,价格并非主要矛盾,可以等周边工具链成熟后再考虑迁移。

消息来自 HEX2077 AI资讯日报(2026年9月19日),原始出处 https://www.aibase.com/zh/news/31156

相关阅读

这条线上还有几篇站内文章可以接着看: