Cloudflare 开源 Clef 决策模型:39ms 出结果,让 AI Agent 路由不再卡壳

2026年10月1日,Cloudflare 发布两款开源决策模型 Clef(270亿参数)和 Clef-flash(90亿参数)。与通用语言模型不同,Clef 不写文字,直接输出概率数字——「这笔工单是退款还是 bug?置信度 0.97」「这张图需要人工复核吗?0.23」。两款模型均基于通义千问微调,开源权重发布数小时内即登 Hugging Face 热门榜第一。

为什么 Agent 需要专门的决策模型

当前 AI Agent 的典型架构是「大模型包揽一切」:收到一封邮件,先让 GPT-6 判断是投诉还是咨询,再让它选工具,最后让它写回复。这个流程的问题在于,大模型生成一段话需要数秒,而工单路由、内容审核这类分支判断,本质上只需要一个分类答案——大模型在这种事上又慢又贵,而且输出的文字还需要额外解析才能变成代码指令。

决策模型(Decision Model)正是解决这个问题的专用工具。它只做一件事:接收一段输入加上一组预定义选项,输出每个选项的概率。整个过程无需生成文字,直接就是程序可用的结构化数据,中间件直接消费,无需解析层。

核心架构:冻结千问 + 评分头

Clef 的架构设计非常清晰:底层是冻结的通义千问(Clef 基于 Qwen3.8-27B,Clef-flash 基于 Qwen3.5-9B),在此之上新增一个轻量评分头(Scoring Head)。训练时冻结千问参数,只更新评分头和低秩适配器(LoRA)。

这种方法的优势是:千问的语义理解能力完全保留,评分头专门学习「给什么选项打高分」。推理时不需要自回归解码 token,评分头直接对所有选项做并行打分,一次前向传播即可输出结果——这正是 39ms 延迟的技术来源。

速度:39ms 中位延迟,数量级碾压通用大模型

Cloudflare 官方在 43 项基准测试中披露了以下数据:

模型 中位延迟 BFCL 函数调用准确率 BANKING77 Macro-F1 API Bank 准确率
Clef-flash(9B) 39ms 98.76% — 93.11%
Clef(27B) 209ms 98.47% 94.2 91.93%
TypeSafe Jev(对比) 524ms — 79.7 88.19%
通用 LLM(典型) 数秒 — — —

Clef-flash 的 39ms 是什么概念?比竞品 Jev 快 13 倍,比通用大模型快 2 个数量级。这个速度已经可以塞进大多数生产请求链路里。Cloudflare 自己的威胁情报团队实测:用 Clef 做网站分类决策,全流程(含网页抓取、渲染、决策)只需 2.2 秒,而通用 LLM 方案需要 4.7 秒——速度提升一倍有余。

三种问题类型:Yes/No、Choice、Score

Clef 支持三种结构化问题类型,覆盖 Agent 系统中绝大多数路由场景:

  • Yes/No:返回 0-1 的概率,如「这笔工单是否紧急?」→ 0.85,可直接设定阈值(超过 0.8 自动升级)
  • Choice(2-255选项):返回每个选项的得分,如「应该分配给哪个团队?」→ {售后: 0.72, 技术支持: 0.18, 风控: 0.10},取最大值即可路由
  • Score(2-10级):返回有序刻度得分,如「内容违规严重程度?」→ 7/10,可用于决定处置方式

由于输出受限于预定义 schema,模型永远不可能返回一个「无效答案」。这对生产系统至关重要——大模型偶尔会输出格式错误或偏离指令的回复,决策模型从根本上规避了这个问题。

API 兼容 Jev:换掉不用改代码

Clef 与 TypeSafe AI 的 Jev API 完全兼容。对接方只需把 endpoint 换成 Clef,无需修改调用代码,就能实现无缝切换。这意味着决策模型这个赛道正在快速商品化:模型供应商之间切换成本极低,壁垒将转移到「谁校准得更好、谁支持微调」上。

定价方面,Cloudflare Workers AI 上 Clef 为 $0.24/百万 token,Clef-flash 为 $0.09/百万 token(对比:Jev 约 $0.042/百万 token,Clef 更贵但速度领先一个量级)。自托管则完全免费——权重在 Hugging Face 公开,Apache 2.0 许可允许商业使用。

Cloudflare RL 定制平台:用自己的数据训练专属决策模型

与模型同步发布的还有一个 RL 微调服务(Reinforcement Learning for Calibrated Decisions)。完整流程是:企业通过 AI Gateway 采集真实决策数据 → Cloudflare 工程师用 RLCD 方法在自有数据上微调评分头 → 部署到 Workers AI 或自托管。整个链路对调用方透明,无需机器学习专业知识,有 API 对接经验即可使用。

Cloudflare 自己也用 Clef 替换了内部的内容审核工单路由、滥用举报分类和爬虫/真人识别流程。Apache 2.0 许可意味着企业可以把模型部署在私有网络里,工单和客户数据完全不离开自有基础设施。

决策模型赛道现状:TypeSafe Jev、OpenAI Decisions API、Cloudflare Clef

Cloudflare 是近三周内第三家入局决策模型的厂商。TypeSafe AI 的 Jev 于 9 月中旬首发,OpenAI 于 9 月底推出基于 GPT-6 Luna 的 Decisions API,Cloudflare Clef 是第三家且是唯一开源权重的。对于有数据安全要求的企业来说,能自托管的 Clef 有明显优势。

FAQ

决策模型和通用大模型怎么选?
路由、分流、审核、评级这类「有预定义选项」的任务用决策模型,速度快 10 倍、成本低一个量级;需要生成内容、分析意图、写文案、做复杂推理的用通用大模型。两者可以组合:先用 Clef 判断意图类型,再根据类型调用专用大模型执行具体操作。

Clef 的概率输出可信吗?
Clef 使用 Brier Loss 加 RLCD 方法联合训练,专门优化「概率数字与真实正确率的一致性」。Cloudflare 的 BANKING77 测试中 Clef 达到 94.2 Macro-F1,远超 Jev 的 79.7。但概率校准需在实际部署中验证,建议在高风险决策场景(金融、医疗)前保留人工复核机制。

两款 Clef 怎么选?
追求极致延迟选 Clef-flash(39ms,9B 参数,适合实时路由);追求最高准确率选 Clef(27B,98.47% BFCL,适合复杂分类)。两者在 Hugging Face 均有开源权重,Apache 2.0 许可允许商业使用且可自托管。

小结

Cloudflare Clef 的发布代表一个明确信号:Agent 系统的「路由层」正在被商品化、专业化,从大模型里分离出来成为一个独立赛道。这是合理的技术演进方向——专用工具做专事,速度快 10 倍,成本低一个量级。对于需要高频分支判断的生产系统(客服工单、内容审核、风险控制、工具路由),现在有了一个免费、可自托管、速度极快的开源选项。随着决策模型赛道的竞争加剧,企业自托管 + 定制微调将成为主流部署形态。

相关阅读:OpenAI Dots 常驻智能体:GPT-6 Astra 驱动,4000+ 应用集成