结论先说:Laya 是 2026 年 9 月 18 日由 Convai Innovations 发布的开源「System 1 决策模型」,Apache 2.0 授权、权重可下载、单卡 T4 上单次推理 32.8 毫秒,约为 TypeSafe Jev 的 7.8 倍;但它的 0.766 基准成绩来自微调后的专用 checkpoint,零样本只有 0.362,且在 77 选项的 Banking77 上以 0.425 惨败给 Jev 的 0.870。它不是「Jev 的免费平替」,而是一个需要你自己微调、自己校准温度、自己控制选项数量的快速决策底座。
Laya 是什么:不生成文本,只输出概率
绝大多数 AI 流水线都在用生成式大模型回答「一句话就能答完」的问题:这封邮件归哪个部门?这条工单紧急度几分?这个 Prompt 是不是越狱尝试?调用一次 LLM意味着等 500–2000 毫秒 token 流式吐完、付每千 token 的钱、再从自由文本里抠出一个标签,而模型自称的「confidence: 0.95」只是「听起来自信的 token」,不是经过校准的概率。
Laya 的做法是把这类判断从「生成」改成「打分」。它使用双向编码器(非自回归),输入一段 state(文本、邮件、工单、JSON 皆可)加一组带类型的提问,一次前向传播同时给出所有答案:
- choice:从你定义的候选字典中挑一个,返回每个选项的概率分布 + 置信度;
- score:把输入放到有序量表上(如 0–3 级紧急度),返回期望等级与分布;
- noul:对是非问题返回校准后的 P(true),取值 0.0–1.0。
因为输出空间只有数字和类别,模型在物理上无法输出散文,也就无从幻觉、无从返回畸形 JSON。训练采用 RLCD(针对严格 proper scoring rule 的强化学习),只有当模型报告诚实概率时奖励才最大化——这是它的置信度可以直接拿来做生产分支判断的根本原因。
三个 checkpoint:一套权重,三种分工
Laya 把三个 checkpoint 放在同一个 Hugging Face 仓库里,按需下载子目录,不会拉全量 2.5 GB。
| Checkpoint | 底座 | 参数量 | 上下文 | 适用场景 |
|---|---|---|---|---|
| laya | ModernBERT-large | 421M | 512 tokens | 英文分类、护栏、邮件分诊 |
| laya-multilingual | mmBERT-base(256k 词表) | 322M | 1024 tokens | 100+ 语言,吞吐约为英文版 2 倍 |
| laya-typed-decisions | ModernBERT-large | 421M | 1024 tokens | 专用决策流程(客服、安全告警、Agent 可观测) |
结构上是 ModernBERT-large 提供 395M 参数,上面接一个从零训练的决策头:2 层 Transformer、选项标记打分器、以及一个 act/escalate(自动执行 vs 转人工)门控,合计 421M。每个选项在各自的 [MASK] 位置独立打分后对该问题的选项集做 softmax,因此答案空间在请求时才定义,新增 schema 不需要重新训练。
多语言路由:解决「看不见的静默失败」
这是 Laya 最值得单独讲的设计。在 MASSIVE 的 51 语言评测中,英文 checkpoint 在高棉语上准确率 0.000,却报告了 0.952 的置信度;亚美尼亚语准确率 0.05、置信度 0.885。一个读不懂输入文字的模型,自信度却从不下降——这是最危险的生产事故类型。
Laya 因此在前向传播之前插入 Router:跨 22 种字母表检测 Unicode 文字并结合拉丁语停用词分布判断语言,标准英文开销 <1 毫秒(不到总前向耗时的 2%),命中非拉丁文字时自动切到多语言 checkpoint。配合 Router(preload=True) 让三个 checkpoint 常驻内存,可消除实测 7–10 秒的冷热切换惩罚。
Laya vs Jev:把比分牌和它的星号一起看
Jev 由 TypeSafe AI(联合创始人 Diogo Almeida 为 ChatGPT 共同发明人之一)于 2026 年 9 月 15 日发布,闭源、按量计费,每百万输入 token 0.042 美元;Laya 三天后开源发布。需要提醒的是:下表 Jev 的数值来自第三方独立评测(AbdelStark、nibzard)与 TypeSafe 官方公布,并非同一轮实测对照。
| 维度 | Laya(开源) | Jev 1.13.0(闭源) | 差距 |
|---|---|---|---|
| 单次推理延迟 P50 | 32.8 ms(T4,自测) | 236–276 ms(第三方公布) | Laya 约快 7.8 倍 |
| 批量 10 问延迟 | 72.3 ms 总计(7.2 ms/问) | 约 1500 ms(串行) | 约 20 倍 |
| typed-decisions(2000 决策) | 0.766(微调后)/ 0.362(零样本) | 0.727(公布值) | 微调后 +3.9 |
| AG News(4 类) | 0.950 | 0.910 | +4.0 |
| DAIR Emotion(6 类) | 0.595 | 0.480 | +11.5 |
| Banking77(77 类) | 0.425 | 0.870 | Jev +44.5 |
| 校准误差 ECE(越低越好) | 0.081(温度重拟合后;出厂 0.466) | 0.246 | 约 3 倍优 |
| 可用语言(>3 倍随机) | 45 / 51 | 无公开基准 | — |
| 每百万 token 成本 | 0 美元(自托管) | 0.042 美元(计量 API) | — |
| 权重与代码 | 完整 safetensors,Apache 2.0 | 闭源,需等待名单 | — |
补充一个常被忽略的反向指标:在 typed-decisions 上,Laya 的 argmax 准确率更高(0.766 vs 0.727),但软分布匹配反而落后(0.471 vs 0.580)。如果你要的是复现教师的完整概率分布而不只是「选对」,Jev 仍有优势。
九个真实工作流的表现
在官方公布的九项企业流程评测中,Laya 表现分化明显——窄口径二分类极强,宽口径多路路由一般:
- 邮件垃圾过滤(Enron):准确率 0.993,F1 0.993,ECE 0.013
- 钓鱼邮件检测:准确率 0.980,F1 0.979,ECE 0.012
- LLM 护栏与越狱检测(held-out ToxicChat):0.755–0.762;50% 选择性覆盖下升至 0.931
- RAG 段落相关性过滤:单次前向 0.657
- 工单队列路由(10 路):0.522
四条诚实的局限
- 零样本接近瞎猜。 基础 checkpoint 在 typed-decisions 上约 0.35,只比 0.318 的随机基线高一点,甚至低于 0.461 的多数类基线。0.766 这个数字来自在基准自身训练 split 上的微调——把它当「需要特化的快底座」,不要当零样本神谕。
- 选项超过 20 个就崩。 Banking77 上是架构性约束:所有选项共享 192–256 token 的 head_max_len 预算,77 个选项每个只剩 3–4 个 token。官方建议把 head_max_len 提到 512+,或改用「粗分类→细分类」两级层级。
- 校准是活儿,不是属性。 出厂权重带的是原始温度 logits,ECE 0.466;按(问题类型 × 选项数)在你自己的分布上拟合一个标量温度后降到 0.081。多语言 checkpoint 出厂完全没有拟合温度,必须自己来。
- 上下文只够一封邮件。 英文 checkpoint 512 token 窗口,装不下一整条客服会话历史,长输入需要换 checkpoint 或做切分。另外 score(有序量表)是三个原语里最弱的,SST-5 上仅 0.372。
部署层面还有一个实测提醒:Flowtivity 在一台 4 vCPU / 7 GB 内存的纯 CPU VPS 上跑 0.3.4 版本,导入 26 秒、checkpoint 加载(含下载)675 秒、首次冷推理 85.4 秒、热推理中位数 49.4 秒。官方给出的健康硬件 CPU 数字是 193–464 毫秒。没有 GPU 时,Laya 是批处理工具,不是请求链路组件,交互式场景请预留 T4 级显卡。
30 秒上手
pip install laya>=0.3.3
import laya
from laya import Router
router = Router(preload=True) # 三个 checkpoint 常驻,路由零成本
state = {"subject": "发票 4411 重复扣款",
"body": "三月份被扣了两次费用,请在周五前退款,否则我们将取消套餐。"}
questions = {
"department": {"type": "choice",
"instructions": "这封邮件该转给哪个部门?",
"criteria": {"billing": "发票、支付、退款",
"technical": "故障、宕机、集成",
"sales": "报价、合同"}},
"urgency": {"type": "score",
"instructions": "这封邮件有多紧急?",
"criteria": ["不急", "尽快", "有截止期限或阻塞性问题"]},
"churn_risk": {"type": "noul",
"instructions": "用户是否威胁取消或转向竞品?"},
}
result = router.predict(state, questions)
conf = result["answers"]["department"]["confidence"]
if conf >= 0.85:
route_automatically(result["answers"]["department"]["choice"])
else:
escalate_to_human(result["answers"]["department"]["choice"],
reason=f"置信度不足 ({conf:.2f})")
微调门槛也不高:官方提供的 Kaggle 笔记本可在两块免费 T4 上约 4 小时完成专用决策模型训练。注意若环境装了 TensorFlow,transformers 导入时会探测并可能因 abseil 运行时死锁,需要 USE_TF=0。
该选哪个:按决策类型,不按热度
选 Laya 的场景:能标注几千条自有样本;数据必须留在自己机房(合规、气隙部署);需要把决策塞进请求链路内且要求亚 50 毫秒;有多语言流量但不想付每 token 费用;选项数控制在 20 以内。
继续用 Jev(或先观望)的场景:今天就要零配置上线;依赖开箱即用的宽泛零样本能力;候选项超过 20(如 Banking77 这类 77 类意图识别);需要复现完整软概率分布。
成本其实不是决定性因素——按每百万 token 0.042 美元计算,一个月 4 万次决策的 intake 流程约 1.34 美元,相比走前沿大模型方案的约 900 美元本就已经很便宜。真正的取舍是:计量计费的便利与等待名单,换取自持基础设施与微调责任。
FAQ
Laya 真的比 Jev 快 7.8 倍吗?
在 T4 GPU 上按同一测量口径,Laya 单次 P50 为 32.8 毫秒,Jev 公布的 P50 为 236–276 毫秒,比值约 7.8 倍;批量 10 问时 Laya 为 7.2 ms/问,比 Jev 串行约 1500 毫秒快约 20 倍。需注意 Jev 数据来自第三方公布而非同轮实测,且差距只有在高吞吐流水线(每小时上千条工单分诊、每次请求前做护栏)里才有业务意义,偶发单次调用感知不到。
Banking77 上 Laya 只有 0.425,还能用吗?
能用,但要改用法。该失败是 token 预算约束而非能力缺陷:77 个选项共享 192–256 token,每个候选只剩 3–4 token。可行解法是把 head_max_len 提升到 512 以上,或改为两级「粗分类→细分类」层级结构,让每一级的选项数都保持在 20 以内。若业务本身就是 77 类平铺意图识别且无法改造,Jev 的 0.870 目前仍是更好的选择。
为什么说 Laya 的置信度不能直接拿来用?
因为出厂权重没有做温度拟合,ECE 高达 0.466,属于系统性过度自信;只有在你自己的数据分布上按问题类型拟合一个标量温度后,ECE 才降到宣传的 0.081。多语言 checkpoint 出厂更是完全未拟合温度。也就是说,conf >= 0.85 就自动放行 这类门控逻辑必须先完成温度校准才能上线,并且上线后建议每周把置信度与实际结果对照记录一次。
小结
Laya 的价值不在「赢了 Jev」,而在于它证明了决策层可以不锁在别人 API 后面:421M 参数、Apache 2.0 权重、自家硬件、零 token 账单、可审查可重拟合。它的短板同样公开写在 README 里——零样本近乎随机、宽选项集崩塌、温度要自己调、上下文只够一封邮件。作者 Nandakishor Mukkunnoth 声称自己 2025 年 3 月的 arXiv 论文(2503.23303)才是这条非自回归决策路线的首发,Jev 是「换个包装的突破」;这场优先权之争未必有结论,但市场信号已经很清楚:模型领先不是护城河,你的数据、阈值、审计轨迹和流程封装才是。工程上更稳妥的做法是把决策层藏在薄接口后面,让 Jev、Laya 或下一季的新模型都能在一天工作量内被换掉。
信息来源:Hugging Face 模型卡 convaiinnovations/laya、GitHub NandhaKishorM/laya、LavX News《Laya offers open-source alternative to proprietary AI decision engines, hitting 32ms latency》、Flowtivity《Laya: The Open-Source Jev Alternative, Benchmarked Honestly》、AlphaSignal、Artifilog《Laya vs Jev》。
