Cloudflare Clef-omni开放音视频多模态:130毫秒出决策,权重开源

Cloudflare 于 10 月 9 日正式发布开放权重决策模型 Clef-omni,新增对音频与视频的原生多模态支持。用户可通过单一 API 接口同时处理 wav、mp3、mp4、webm 等多种音视频格式,无需额外部署语音转写或音视频拆分流程。该模型基于 Qwen3-Omni-30B-A3B-Instruct 构建,主要面向结构化决策任务,输出最优解及对应概率评分而非常规文本。性能方面,纯文本请求中位响应时间约 130 毫秒,图像约 150 毫秒,整体推理效率处于业界领先水平。

从文本图像到音视频:多模态能力升级

Clef-omni 在前代 Clef 的文本与图像处理基础之上,首次将音频和完整视频纳入原生输入范畴。传统方案处理视频时,通常需要先调用语音识别将音频转写为文本,再对图像序列进行独立处理,流程繁琐且延迟较高。Clef-omni 则可对 mp4、webm 等完整视频文件直接进行端到端理解,开发者只需一次 API 调用即可获得结构化决策结果。

技术底座与开放生态

Clef-omni 以 Qwen3-Omni-30B-A3B-Instruct 为基座,保留了 Qwen 系列的原生多模态理解能力。该模型不生成常规文本回复,而是专注于从预设选项中选出最优方案,并附带各选项的概率评分,适用于路由分发、内容分类、AI Agent 动作选择等场景。模型权重已在 Hugging Face 开放,开发者可自由部署与微调。

这是 Clef 系列自今年早些时候开源文本图像版本以来最重要的一次迭代升级,也是 Cloudflare 在 AI 基础设施领域从网络加速向模型层拓展的关键一步。

相关阅读:Cloudflare 开源 Clef 决策模型:39ms 出结果,让 AI Agent 路由不再卡壳