Cloudflare发布Clef-omni:原生支持音视频多模态决策,130毫秒出结果

Cloudflare近期正式发布全新开放权重决策模型Clef-omni,在原有Clef系列基础上实现重大升级:不仅保留文本与图像处理能力,更首次新增对音频和完整视频输入的直接支持,模型权重已在Hugging Face全面开源。该公司同时宣布下调Clef-flash的输入定价,降幅约58%。

音视频统一处理:无需预处理管道

此前版本的Clef面对视频输入时需先将视频按时间轴拆解为连续静态图像再处理,这一预处理步骤不仅耗时,还容易丢失音频中的上下文信息。Clef-omni则直接支持wav、mp3、mp4和webm等主流格式,开发者无需再单独搭建语音转写及音视频拆分管道,单次API调用即可完成文本、图像、音频和视频的统一处理,大幅降低了多模态决策应用的开发门槛。

性能基准与定价调整

Clef-omni基于Qwen3-Omni-30B-A3B-Instruct底座架构构建,专注于结构化决策任务,不输出常规冗长文本。实测纯文本请求中位响应时间约130毫秒,图像请求约150毫秒,处理一段21秒带声音视频约需1.5秒。伴随新模型发布,Clef-flash输入价格下调约58%,从每百万Token 0.09美元降至0.038美元,托管版的上下文窗口则由64k调整为24k。

Clef-omni的另一个亮点是其极低的推理延迟。Cloudflare在全球部署了300多个数据中心节点,模型推理就近调度,文本请求的P50延迟控制在130毫秒以内,对于需要实时决策的场景(如欺诈检测、容错路由)具有实际应用价值。此前企业构建类似能力需要自行集成多个专用模型,现在只需调用一个API。

相关阅读:Cloudflare Clef-omni评测:首个音视频开放权重决策模型