Cloudflare 10月9日发布开放权重决策模型 Clef-omni,首次在单一 API 接口里同时支持文本、图像、音频(WAV/MP3)和视频(MP4/WebM)四种输入模态,文本决策中位延迟约 130 毫秒,21 秒带声视频约 1.5 秒完成评分,权重以 Apache-2.0 协议开源在 Hugging Face。
这不是一次简单的功能叠加。在 Clef-omni 之前,开发者要对一段录音或一段视频做分类判断,必须先用语音识别模型把音频转成文字(或用抽帧模型把视频切成图像序列),再把文字扔给大模型判断——两到三个模型串联,延迟叠加,费用翻番。Clef-omni 把这条路彻底压成一步:一个 API 调用,原生接收音频或视频流,直接输出带校准的评分结果。
技术架构:去掉语音合成,冻结主干微调 LoRA
Clef-omni 以 Qwen3-Omni-30B-A3B-Instruct 为骨干。这是一款支持「理解+生成双轨」的原生多模态模型,思维链和语音输出组件俱全。Cloudflare 在其基础上摘掉了语音合成模块(TTS 部分),保留全部理解能力,然后用 LoRA 低秩适配方法在后端做了后训练:冻结主干骨干,用带标签平滑的交叉熵损失加 Brier 分数校准目标微调适配层。
这一设计的直接结果是:模型不生成常规文本输出,只做 schema 约束的结构化评分——延迟极低,延迟来源只有「输入理解+attention+输出一个短向量」,省掉了输出 token 生成的全部计算。
性能与延迟:实测数字一览
| 输入类型 | 中位延迟 | 说明 |
|---|---|---|
| 纯文本 | 约 130ms | Workers AI 托管版实测 |
| 加图像(≤4张) | 约 150ms | 含图像编码开销 |
| 音频(≤300秒) | 几百毫秒级 | 最多个300秒片段 |
| 21秒视频(带声音) | 约 1.5s | 含音频+视频双流解码 |
Cloudflare 还同步调低了 Clef-flash 的价格,从每百万输入 token 0.09 美元降至 0.038 美元,低于竞品 TypeSafe Jev。代价是托管版上下文窗口从 64K 缩至 24K——官方数据显示只有 0.24% 的线上请求超过 24K,因此权重本身仍支持 256K,自托管不受影响。
基准测试:金融意图与客服分流双路领先
| 基准测试 | Clef-omni 得分 | 说明 |
|---|---|---|
| BANKING77 | 94.8 | 银行领域意图分类,业内最高水平之一 |
| CLINC150+OOS | 97.7 | 含域外意图的客服分流基准 |
两项基准分别对应 Clef-omni 最强的两个实际场景:金融领域的精细化意图分类(如「额度查询」「分期手续费计算」「卡片冻结申诉」),以及客服系统的自动分流(含未知意图的兜底处理)。官方还提到 GitHub 文档垃圾评论过滤、EmDash CMS 插件库钓鱼检测、PII 扫描、恶意域名识别等内部用例,均在生产环境运行。
API 设计:Jev 兼容,支持 base64 直传
Workers AI 接口接受最多 4 张图像、4 个音频片段(各最多 300 秒)、2 个视频文件(各最多 60 秒),所有媒体以 base64 编码直接内嵌在请求体里,无需预上传到对象存储再传 URL——这对边缘计算场景是实质性简化。
API 格式与 TypeSafe Jev 兼容,已对接 Cloudflare AI Gateway。对于已有 Jev 集成的团队,切到 Clef-omni 只需改一个模型 ID。同时,作为开放权重模型,它与同样基于 Qwen3-Omni 的 微软 Decision-1 属于同一模型家族的不同后训练方向——Decision-1 面向结构化决策执行,Celf-omni 面向多模态分类打分。
定价对比:决策类模型的独立定价逻辑
| 模型 | 输入价格 | 输出价格 | 托管上下文 |
|---|---|---|---|
| Clef-omni | $0.15/M tokens | 免费 | 64K |
| Clef | $0.24/M tokens | 免费 | 64K |
| Clef-flash(新版) | $0.038/M tokens | 免费 | 24K |
| TypeSafe Jev | 约 $0.05+/M | 计费 | — |
Clef 全系列不收输出 token 费用,因为模型根本不生成常规文本——输出的是一个结构化评分向量。对高频分类/打分场景,这意味着实际单次调用成本显著低于通用 VLMs。
定位与局限:决策模型赛道正在成形
Clef-omni 的出现把「决策模型」这条细分赛道又往前推了一步。TypeSafe Jev 打开了「专用打分模型」的市场,Cloudflare 用 Clef 家族把它扩展到多模态,Clef-omni 补完了音视频最后一环。
需要注意的是,21 秒视频 + 1.5 秒的处理时间意味着它不适合长视频分析场景(如会议纪要生成或长纪录片内容审核),而是定位于「短片段判断」——客服通话片段、工单附带的语音留言、支持票据里的截图或屏幕录制。Workers AI 托管版 64K 的上下文上限也限制了超长音频的应用。
此外,官方 announcement 本身未包含与 Gemini 4 Argon、GPT-6 Astra 等通用 VLMs 在同一基准上的对比数据,开放权重版本与托管版本的性能一致性也需实测验证。
FAQ
Clef-omni 和普通多模态大模型有什么本质区别?
通用大模型(如 GPT-4o、Gemini)处理多模态输入后要生成一段文字回答,输出 token 生成是主要延迟来源。Clef-omni 不生成文本,只输出 schema 约束的结构化评分,绕过了输出生成,所以延迟可以压到毫秒级。代价是它不能做问答、摘要、翻译等生成类任务。
开放权重版本能直接替代托管 API 吗?
可以,但需要自备 GPU。Clef-omni 权重在 Hugging Face 开源(Apache-2.0),支持本地部署。权重支持 256K 上下文,自托管不受 Workers AI 64K 上限限制,适合有合规要求或调用量大的企业。
Clef-flash 降价后还值得用吗?
如果你的场景是纯文本分类或意图识别,Clef-flash($0.038/M)性价比最高,比 TypeSafe Jev 还便宜。Clef-omni($0.15/M)的溢价在于多模态输入能力——如果不需要处理音频/视频,没必要多付这笔钱。
相关阅读
- TypeSafe AI完成8.7亿美元A轮:a16z、红杉领投,Jev日处理数万亿Token
- 微软Decision-1发布:基于Qwen3.5-9B,36项基准测试83.5%准确率
- Qwen-Image-2.1-Turbo开源:8步出图,把采样调度写进权重里
延伸阅读
- TypeSafe AI 发布 Jev:首个 System One 决策模型,自动化任务最高提速 193 倍3 周前
- Laya 开源决策模型 vs Jev 对比:32.8ms 推理快 7.8 倍,Apache 2.0 权重可自托管3 周前
- OpenAI暂停前沿训练:1200个智能体失控背后,100家机构的代价与监管重构1 周前
- AI 3D 工具 Meshy 两年 ARR 破亿:从 100 万到 1 亿美元6 天前
