Laya 开源决策模型 vs Jev 对比:32.8ms 推理快 7.8 倍,Apache 2.0 权重可自托管

结论先说:Laya 是 2026 年 9 月 18 日由 Convai Innovations 发布的开源「System 1 决策模型」,Apache 2.0 授权、权重可下载、单卡 T4 上单次推理 32.8 毫秒,约为 TypeSafe Jev 的 7.8 倍;但它的 0.766 基准成绩来自微调后的专用 checkpoint,零样本只有 0.362,且在 77 选项的 Banking77 上以 0.425 惨败给 Jev 的 0.870。它不是「Jev 的免费平替」,而是一个需要你自己微调、自己校准温度、自己控制选项数量的快速决策底座。

Laya 是什么:不生成文本,只输出概率

绝大多数 AI 流水线都在用生成式大模型回答「一句话就能答完」的问题:这封邮件归哪个部门?这条工单紧急度几分?这个 Prompt 是不是越狱尝试?调用一次 LLM意味着等 500–2000 毫秒 token 流式吐完、付每千 token 的钱、再从自由文本里抠出一个标签,而模型自称的「confidence: 0.95」只是「听起来自信的 token」,不是经过校准的概率。

Laya 的做法是把这类判断从「生成」改成「打分」。它使用双向编码器(非自回归),输入一段 state(文本、邮件、工单、JSON 皆可)加一组带类型的提问一次前向传播同时给出所有答案:

  • choice:从你定义的候选字典中挑一个,返回每个选项的概率分布 + 置信度;
  • score:把输入放到有序量表上(如 0–3 级紧急度),返回期望等级与分布;
  • noul:对是非问题返回校准后的 P(true),取值 0.0–1.0。

因为输出空间只有数字和类别,模型在物理上无法输出散文,也就无从幻觉、无从返回畸形 JSON。训练采用 RLCD(针对严格 proper scoring rule 的强化学习),只有当模型报告诚实概率时奖励才最大化——这是它的置信度可以直接拿来做生产分支判断的根本原因。

三个 checkpoint:一套权重,三种分工

Laya 把三个 checkpoint 放在同一个 Hugging Face 仓库里,按需下载子目录,不会拉全量 2.5 GB。

Checkpoint 底座 参数量 上下文 适用场景
laya ModernBERT-large 421M 512 tokens 英文分类、护栏、邮件分诊
laya-multilingual mmBERT-base(256k 词表) 322M 1024 tokens 100+ 语言,吞吐约为英文版 2 倍
laya-typed-decisions ModernBERT-large 421M 1024 tokens 专用决策流程(客服、安全告警、Agent 可观测)

结构上是 ModernBERT-large 提供 395M 参数,上面接一个从零训练的决策头:2 层 Transformer、选项标记打分器、以及一个 act/escalate(自动执行 vs 转人工)门控,合计 421M。每个选项在各自的 [MASK] 位置独立打分后对该问题的选项集做 softmax,因此答案空间在请求时才定义,新增 schema 不需要重新训练

多语言路由:解决「看不见的静默失败」

这是 Laya 最值得单独讲的设计。在 MASSIVE 的 51 语言评测中,英文 checkpoint 在高棉语上准确率 0.000,却报告了 0.952 的置信度;亚美尼亚语准确率 0.05、置信度 0.885。一个读不懂输入文字的模型,自信度却从不下降——这是最危险的生产事故类型。

Laya 因此在前向传播之前插入 Router:跨 22 种字母表检测 Unicode 文字并结合拉丁语停用词分布判断语言,标准英文开销 <1 毫秒(不到总前向耗时的 2%),命中非拉丁文字时自动切到多语言 checkpoint。配合 Router(preload=True) 让三个 checkpoint 常驻内存,可消除实测 7–10 秒的冷热切换惩罚。

Laya vs Jev:把比分牌和它的星号一起看

Jev 由 TypeSafe AI(联合创始人 Diogo Almeida 为 ChatGPT 共同发明人之一)于 2026 年 9 月 15 日发布,闭源、按量计费,每百万输入 token 0.042 美元;Laya 三天后开源发布。需要提醒的是:下表 Jev 的数值来自第三方独立评测(AbdelStark、nibzard)与 TypeSafe 官方公布,并非同一轮实测对照

维度 Laya(开源) Jev 1.13.0(闭源) 差距
单次推理延迟 P50 32.8 ms(T4,自测) 236–276 ms(第三方公布) Laya 约快 7.8 倍
批量 10 问延迟 72.3 ms 总计(7.2 ms/问) 约 1500 ms(串行) 约 20 倍
typed-decisions(2000 决策) 0.766(微调后)/ 0.362(零样本) 0.727(公布值) 微调后 +3.9
AG News(4 类) 0.950 0.910 +4.0
DAIR Emotion(6 类) 0.595 0.480 +11.5
Banking77(77 类) 0.425 0.870 Jev +44.5
校准误差 ECE(越低越好) 0.081(温度重拟合后;出厂 0.466) 0.246 约 3 倍优
可用语言(>3 倍随机) 45 / 51 无公开基准
每百万 token 成本 0 美元(自托管) 0.042 美元(计量 API)
权重与代码 完整 safetensors,Apache 2.0 闭源,需等待名单

补充一个常被忽略的反向指标:在 typed-decisions 上,Laya 的 argmax 准确率更高(0.766 vs 0.727),但软分布匹配反而落后(0.471 vs 0.580)。如果你要的是复现教师的完整概率分布而不只是「选对」,Jev 仍有优势。

九个真实工作流的表现

在官方公布的九项企业流程评测中,Laya 表现分化明显——窄口径二分类极强,宽口径多路路由一般:

  • 邮件垃圾过滤(Enron):准确率 0.993,F1 0.993,ECE 0.013
  • 钓鱼邮件检测:准确率 0.980,F1 0.979,ECE 0.012
  • LLM 护栏与越狱检测(held-out ToxicChat):0.755–0.762;50% 选择性覆盖下升至 0.931
  • RAG 段落相关性过滤:单次前向 0.657
  • 工单队列路由(10 路):0.522

四条诚实的局限

  1. 零样本接近瞎猜。 基础 checkpoint 在 typed-decisions 上约 0.35,只比 0.318 的随机基线高一点,甚至低于 0.461 的多数类基线。0.766 这个数字来自在基准自身训练 split 上的微调——把它当「需要特化的快底座」,不要当零样本神谕。
  2. 选项超过 20 个就崩。 Banking77 上是架构性约束:所有选项共享 192–256 token 的 head_max_len 预算,77 个选项每个只剩 3–4 个 token。官方建议把 head_max_len 提到 512+,或改用「粗分类→细分类」两级层级。
  3. 校准是活儿,不是属性。 出厂权重带的是原始温度 logits,ECE 0.466;按(问题类型 × 选项数)在你自己的分布上拟合一个标量温度后降到 0.081。多语言 checkpoint 出厂完全没有拟合温度,必须自己来。
  4. 上下文只够一封邮件。 英文 checkpoint 512 token 窗口,装不下一整条客服会话历史,长输入需要换 checkpoint 或做切分。另外 score(有序量表)是三个原语里最弱的,SST-5 上仅 0.372。

部署层面还有一个实测提醒:Flowtivity 在一台 4 vCPU / 7 GB 内存的纯 CPU VPS 上跑 0.3.4 版本,导入 26 秒、checkpoint 加载(含下载)675 秒、首次冷推理 85.4 秒、热推理中位数 49.4 秒。官方给出的健康硬件 CPU 数字是 193–464 毫秒。没有 GPU 时,Laya 是批处理工具,不是请求链路组件,交互式场景请预留 T4 级显卡。

30 秒上手

pip install laya>=0.3.3
import laya
from laya import Router

router = Router(preload=True)          # 三个 checkpoint 常驻,路由零成本

state = {"subject": "发票 4411 重复扣款",
         "body": "三月份被扣了两次费用,请在周五前退款,否则我们将取消套餐。"}
questions = {
  "department": {"type": "choice",
                 "instructions": "这封邮件该转给哪个部门?",
                 "criteria": {"billing": "发票、支付、退款",
                              "technical": "故障、宕机、集成",
                              "sales": "报价、合同"}},
  "urgency":    {"type": "score",
                 "instructions": "这封邮件有多紧急?",
                 "criteria": ["不急", "尽快", "有截止期限或阻塞性问题"]},
  "churn_risk": {"type": "noul",
                 "instructions": "用户是否威胁取消或转向竞品?"},
}

result = router.predict(state, questions)
conf = result["answers"]["department"]["confidence"]
if conf >= 0.85:
    route_automatically(result["answers"]["department"]["choice"])
else:
    escalate_to_human(result["answers"]["department"]["choice"],
                      reason=f"置信度不足 ({conf:.2f})")

微调门槛也不高:官方提供的 Kaggle 笔记本可在两块免费 T4 上约 4 小时完成专用决策模型训练。注意若环境装了 TensorFlow,transformers 导入时会探测并可能因 abseil 运行时死锁,需要 USE_TF=0

该选哪个:按决策类型,不按热度

选 Laya 的场景:能标注几千条自有样本;数据必须留在自己机房(合规、气隙部署);需要把决策塞进请求链路内且要求亚 50 毫秒;有多语言流量但不想付每 token 费用;选项数控制在 20 以内。

继续用 Jev(或先观望)的场景:今天就要零配置上线;依赖开箱即用的宽泛零样本能力;候选项超过 20(如 Banking77 这类 77 类意图识别);需要复现完整软概率分布。

成本其实不是决定性因素——按每百万 token 0.042 美元计算,一个月 4 万次决策的 intake 流程约 1.34 美元,相比走前沿大模型方案的约 900 美元本就已经很便宜。真正的取舍是:计量计费的便利与等待名单,换取自持基础设施与微调责任

FAQ

Laya 真的比 Jev 快 7.8 倍吗?

在 T4 GPU 上按同一测量口径,Laya 单次 P50 为 32.8 毫秒,Jev 公布的 P50 为 236–276 毫秒,比值约 7.8 倍;批量 10 问时 Laya 为 7.2 ms/问,比 Jev 串行约 1500 毫秒快约 20 倍。需注意 Jev 数据来自第三方公布而非同轮实测,且差距只有在高吞吐流水线(每小时上千条工单分诊、每次请求前做护栏)里才有业务意义,偶发单次调用感知不到。

Banking77 上 Laya 只有 0.425,还能用吗?

能用,但要改用法。该失败是 token 预算约束而非能力缺陷:77 个选项共享 192–256 token,每个候选只剩 3–4 token。可行解法是把 head_max_len 提升到 512 以上,或改为两级「粗分类→细分类」层级结构,让每一级的选项数都保持在 20 以内。若业务本身就是 77 类平铺意图识别且无法改造,Jev 的 0.870 目前仍是更好的选择。

为什么说 Laya 的置信度不能直接拿来用?

因为出厂权重没有做温度拟合,ECE 高达 0.466,属于系统性过度自信;只有在你自己的数据分布上按问题类型拟合一个标量温度后,ECE 才降到宣传的 0.081。多语言 checkpoint 出厂更是完全未拟合温度。也就是说,conf >= 0.85 就自动放行 这类门控逻辑必须先完成温度校准才能上线,并且上线后建议每周把置信度与实际结果对照记录一次。

小结

Laya 的价值不在「赢了 Jev」,而在于它证明了决策层可以不锁在别人 API 后面:421M 参数、Apache 2.0 权重、自家硬件、零 token 账单、可审查可重拟合。它的短板同样公开写在 README 里——零样本近乎随机、宽选项集崩塌、温度要自己调、上下文只够一封邮件。作者 Nandakishor Mukkunnoth 声称自己 2025 年 3 月的 arXiv 论文(2503.23303)才是这条非自回归决策路线的首发,Jev 是「换个包装的突破」;这场优先权之争未必有结论,但市场信号已经很清楚:模型领先不是护城河,你的数据、阈值、审计轨迹和流程封装才是。工程上更稳妥的做法是把决策层藏在薄接口后面,让 Jev、Laya 或下一季的新模型都能在一天工作量内被换掉。

信息来源:Hugging Face 模型卡 convaiinnovations/laya、GitHub NandhaKishorM/laya、LavX News《Laya offers open-source alternative to proprietary AI decision engines, hitting 32ms latency》、Flowtivity《Laya: The Open-Source Jev Alternative, Benchmarked Honestly》、AlphaSignal、Artifilog《Laya vs Jev》。