Cloudflare Clef-omni评测:首个音视频开放权重决策模型,130毫秒出结果

Cloudflare 10月9日发布开放权重决策模型 Clef-omni,首次在单一 API 接口里同时支持文本、图像、音频(WAV/MP3)和视频(MP4/WebM)四种输入模态,文本决策中位延迟约 130 毫秒,21 秒带声视频约 1.5 秒完成评分,权重以 Apache-2.0 协议开源在 Hugging Face。

这不是一次简单的功能叠加。在 Clef-omni 之前,开发者要对一段录音或一段视频做分类判断,必须先用语音识别模型把音频转成文字(或用抽帧模型把视频切成图像序列),再把文字扔给大模型判断——两到三个模型串联,延迟叠加,费用翻番。Clef-omni 把这条路彻底压成一步:一个 API 调用,原生接收音频或视频流,直接输出带校准的评分结果。

技术架构:去掉语音合成,冻结主干微调 LoRA

Clef-omni 以 Qwen3-Omni-30B-A3B-Instruct 为骨干。这是一款支持「理解+生成双轨」的原生多模态模型,思维链和语音输出组件俱全。Cloudflare 在其基础上摘掉了语音合成模块(TTS 部分),保留全部理解能力,然后用 LoRA 低秩适配方法在后端做了后训练:冻结主干骨干,用带标签平滑的交叉熵损失加 Brier 分数校准目标微调适配层。

这一设计的直接结果是:模型不生成常规文本输出,只做 schema 约束的结构化评分——延迟极低,延迟来源只有「输入理解+attention+输出一个短向量」,省掉了输出 token 生成的全部计算。

性能与延迟:实测数字一览

输入类型 中位延迟 说明
纯文本 约 130ms Workers AI 托管版实测
加图像(≤4张) 约 150ms 含图像编码开销
音频(≤300秒) 几百毫秒级 最多个300秒片段
21秒视频(带声音) 约 1.5s 含音频+视频双流解码

Cloudflare 还同步调低了 Clef-flash 的价格,从每百万输入 token 0.09 美元降至 0.038 美元,低于竞品 TypeSafe Jev。代价是托管版上下文窗口从 64K 缩至 24K——官方数据显示只有 0.24% 的线上请求超过 24K,因此权重本身仍支持 256K,自托管不受影响。

基准测试:金融意图与客服分流双路领先

基准测试 Clef-omni 得分 说明
BANKING77 94.8 银行领域意图分类,业内最高水平之一
CLINC150+OOS 97.7 含域外意图的客服分流基准

两项基准分别对应 Clef-omni 最强的两个实际场景:金融领域的精细化意图分类(如「额度查询」「分期手续费计算」「卡片冻结申诉」),以及客服系统的自动分流(含未知意图的兜底处理)。官方还提到 GitHub 文档垃圾评论过滤、EmDash CMS 插件库钓鱼检测、PII 扫描、恶意域名识别等内部用例,均在生产环境运行。

API 设计:Jev 兼容,支持 base64 直传

Workers AI 接口接受最多 4 张图像、4 个音频片段(各最多 300 秒)、2 个视频文件(各最多 60 秒),所有媒体以 base64 编码直接内嵌在请求体里,无需预上传到对象存储再传 URL——这对边缘计算场景是实质性简化。

API 格式与 TypeSafe Jev 兼容,已对接 Cloudflare AI Gateway。对于已有 Jev 集成的团队,切到 Clef-omni 只需改一个模型 ID。同时,作为开放权重模型,它与同样基于 Qwen3-Omni 的 微软 Decision-1 属于同一模型家族的不同后训练方向——Decision-1 面向结构化决策执行,Celf-omni 面向多模态分类打分。

定价对比:决策类模型的独立定价逻辑

模型 输入价格 输出价格 托管上下文
Clef-omni $0.15/M tokens 免费 64K
Clef $0.24/M tokens 免费 64K
Clef-flash(新版) $0.038/M tokens 免费 24K
TypeSafe Jev 约 $0.05+/M 计费 —

Clef 全系列不收输出 token 费用,因为模型根本不生成常规文本——输出的是一个结构化评分向量。对高频分类/打分场景,这意味着实际单次调用成本显著低于通用 VLMs。

定位与局限:决策模型赛道正在成形

Clef-omni 的出现把「决策模型」这条细分赛道又往前推了一步。TypeSafe Jev 打开了「专用打分模型」的市场,Cloudflare 用 Clef 家族把它扩展到多模态,Clef-omni 补完了音视频最后一环。

需要注意的是,21 秒视频 + 1.5 秒的处理时间意味着它不适合长视频分析场景(如会议纪要生成或长纪录片内容审核),而是定位于「短片段判断」——客服通话片段、工单附带的语音留言、支持票据里的截图或屏幕录制。Workers AI 托管版 64K 的上下文上限也限制了超长音频的应用。

此外,官方 announcement 本身未包含与 Gemini 4 Argon、GPT-6 Astra 等通用 VLMs 在同一基准上的对比数据,开放权重版本与托管版本的性能一致性也需实测验证。

FAQ

Clef-omni 和普通多模态大模型有什么本质区别?
通用大模型(如 GPT-4o、Gemini)处理多模态输入后要生成一段文字回答,输出 token 生成是主要延迟来源。Clef-omni 不生成文本,只输出 schema 约束的结构化评分,绕过了输出生成,所以延迟可以压到毫秒级。代价是它不能做问答、摘要、翻译等生成类任务。

开放权重版本能直接替代托管 API 吗?
可以,但需要自备 GPU。Clef-omni 权重在 Hugging Face 开源(Apache-2.0),支持本地部署。权重支持 256K 上下文,自托管不受 Workers AI 64K 上限限制,适合有合规要求或调用量大的企业。

Clef-flash 降价后还值得用吗?
如果你的场景是纯文本分类或意图识别,Clef-flash($0.038/M)性价比最高,比 TypeSafe Jev 还便宜。Clef-omni($0.15/M)的溢价在于多模态输入能力——如果不需要处理音频/视频,没必要多付这笔钱。

相关阅读