结论先行:TypeSafe AI 于 2026 年 9 月 20 日宣布,其旗舰模型 Jev 正式面向全体开发者开放——取消等待名单,新注册账号直接获得 5 美元免费额度。按官方输入价 0.042 美元/百万 Token 折算,这 5 美元约等于 1.2 亿 Token 的调用量。一个把「机器决策」当成独立品类来做、并且拒绝生成任何文字的模型,从今天起不再需要申请就能上手。
这也是 Jev 从 Early Access 走向 GA 的一步。此前开发者必须提交申请、等待审批才能拿到 API Key;现在注册即用。
先回顾:Jev 是一个「不写字」的模型
大模型默认的工作方式是自回归地预测下一个 Token,直到生成一段文本。Jev 明确拒绝这份工作说明书:它读取一段非结构化状态(工单、邮件、diff、转录文本等),对着预先定义好的问题集合,返回类型化的答案 + 校准过的概率,一个字的自由文本都不输出。
TypeSafe 把它归类为 System One Model——取名自「思考,快与慢」里那套快速直觉系统,对应的场景就是软件里那些高频、琐碎但必须做的判断:分类、路由、打分、分流、兜底审查。
模型名 Jev 来自经济学家 William Stanley Jevons,即那个「越便宜用得越多」的杰文斯悖论;公司 CEO Diogo Almeida 是前 OpenAI 研究员,参与过 ChatGPT 与 RLHF(基于人类反馈的强化学习)的早期工作。
全面开放后,到底变了什么
| 维度 | Early Access 阶段 | 全面开放后 |
|---|---|---|
| 接入方式 | 需提交申请、等待审批 | 注册即可用,无等待名单 |
| 新用户额度 | 无明确免费额度说明 | 5 美元免费额度,约 1.2 亿 Token |
| 定价 | 0.042 美元/百万输入 Token | 维持不变,输出 Token 免费 |
| 模型版本 | jev-preview 等预览别名 | jev-1.13.0(jev-latest 指向它) |
| 接口 | 早期形态未完全固定 | 固定单一端点 POST /v1/systemone |
值得注意的是「输出 Token 免费」这件事为什么成立:Jev 根本不产生输出 Token。它返回的只是预定义答案空间上的概率分布,体量小到可以直接定价为零。这也是它能把成本压下来、并且从结构上杜绝「编造事实」的原因——模型无法输出它没被允许输出的内容。
三种问题类型就是全部词汇表
Jev 的接口词汇非常小,只有三种题型,可以在一次请求中混用、并行独立评估:
| 类型 | 作用 | 返回 |
|---|---|---|
| Choice | 从多个候选项里挑一个(官方声明基数上限 255) | 选中的项 + 每个选项的概率 |
| Score | 按有序等级打分 | 得分 + 每个等级的概率 |
| Noul | 判断某陈述是否成立 | 0 到 1 之间的概率 |
调用形态大致如下(官方 SDK 为 Python 与 TypeScript 两套):
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
client = TypeSafeClient(model="jev-1.13")
result = client.system_one(
{"ticket": ticket_text},
{
"refund": Noul(instructions="Is the customer asking for a refund?"),
"team": Choice(options=["billing", "shipping", "engineering"]),
"mood": Score(levels=["calm", "annoyed", "furious"]),
},
)
落到 HTTP 层面就是一个端点:
curl -X POST https://api.typesafe.ai/v1/systemone \
-H "Authorization: Bearer $TYPESAFE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"state": "Help! My payouts have been failing for 3 days.",
"model": "jev-latest",
"questions": {
"is_urgent": {"type": "noul", "instructions": "Does this convey urgency?"},
"department": {"type": "choice", "instructions": "Which team should handle this?",
"options": ["billing", "shipping", "engineering"]}
}
}'
关键在「校准」二字。TypeSafe 用一套叫 RLCD(Reinforcement Learning for Calibrated Decisions) 的方法训练,借助 Brier score 这类恰当评分规则对齐可验证的真值,目标是:当 Jev 报出 85% 置信度时,它大约 85% 的情况下是对的。这一点直接决定了工程上能不能用阈值来分流——高置信度自动执行,中间区间人工复核,低置信度转人工。
成本怎么算:一百万张工单约 21 美元
定价是这轮讨论的焦点。输入 42 美元/十亿 Token,即 0.042 美元/百万 Token,输出免费。按这个单价做一个算例:
| 项目 | 数值 |
|---|---|
| 单张工单平均输入 | 约 500 Token |
| 总量 | 100 万张 × 500 = 5 亿 Token |
| 输入费用 | 5 亿 ÷ 100 万 × 0.042 ≈ 21 美元 |
| 输出费用 | 0 美元 |
同一层级的分类型任务如果用前沿大模型来做,成本会是另一个量级。除了单价,另一笔隐性收益来自结构本身:输出是类型化的,代码可以直接读取,不需要再写一层 JSON 解析与容错兜底——那层「防解析失败」的样板代码,本身就是延迟与故障的来源。
性能数据要看清口径
官方给出的区间是:端到端 70–500 毫秒(典型约 150 毫秒),在 TypeSafe 自己定义的 System One 任务上比前沿通用模型快 40–200 倍、便宜 40–400 倍。更具体的一组演示数据是 0.114 秒对 8.566 秒、0.000081 美元对 0.013880 美元;TypeSafe 称其输入成本比 Claude Fable 5.1 低 238 倍。
需要如实说明的是:这些数字全部来自 TypeSafe 自建评测,官方在发布时也承认参考真值取自 GPT-6 Astra 与 Fable 5.1 输出的平均。目前尚无第三方独立复现,官方文档里也没有公布准确率数字。另外限流为 250,000 Token/秒与 1,200 请求/分钟,官方注明这两个数值可能会随时调整。
生态接入情况
Jev 本身是闭源的托管 API,不提供权重,所有账号使用同一套权重,也不能微调——要引导它只能靠 state 内容和问题措辞。接入渠道目前包括:自有的 Python SDK(pip install typesafe-sdk)与 JavaScript/TypeScript SDK(@typesafe-ai/sdk)、Vercel AI Gateway(模型标识 typesafe-ai/jev)、Cloudflare Workers AI(typesafe/jev)。官方还放出了一个开源适配器,可以把普通 LLM 包装成同样的 System One 接口,方便在做替换对比时保持调用层不变。
热度方面,据媒体报道,Jev 发布后 5 天内开发者已建起 3000 多个 GitHub 仓库做探索;发布当天流量过大还出现过短暂的 API 抖动。
它做不了什么:使用前必须知道的边界
- 不生成文本:不能聊天、写稿、写代码,工作说明书里没有这一项。
- 不能算术:官方文档明确指出,Jev 无法计数、比较日期或做算术运算。
- 只吃文本:不支持图像、音频、视频输入。
- 上下文 64k:其中 state 与最长问题合计上限 32k,约 15 万字符。
- 非英语能力较弱:以英语为主,中文、日文等 CJK 输入可以接受,但官方文档称「目前准确率较低」。
- 无参数公开:参数量未披露,Closed API,不可自部署。
定位上它不是推理模型的替代品,而是一个组件。最典型的用法是「便宜快速的校准门卫」:放在昂贵模型前面,判断这次请求要不要动用大模型、生成结果是否安全可发布、这份文档该进哪条流水线。这其实是一种双速架构——高频低价值的判断下沉到专用小模型,深度推理留给真正需要的地方。
常见问题(FAQ)
Q1:现在注册要花钱吗?
不需要。取消等待名单后直接注册即可,新账号赠送 5 美元额度,按 0.042 美元/百万输入 Token 折算约合 1.2 亿 Token,足够完成一轮完整的业务验证。
Q2:Jev 能替代我现在的分类模型或正则规则吗?
可以覆盖很大一部分,但要看任务性质。如果判断对象是自然语言、且需要概率化的置信度来分流,Jev 比手写规则更稳;如果只是字符串匹配或纯数值判断,继续用规则更划算。注意它不能做算术,涉及金额计算、日期比较的逻辑必须留给代码。
Q3:中文场景能用吗?
可以用,但要留出准确率折扣。官方文档说明 CJK 输入目前准确率偏低,建议先用自有中文样本跑一轮评测,再决定是否把阈值分流逻辑接进去。
小结
「取消等待名单」这个动作本身看起来不大,但对 Jev 这类定位特殊的模型来说,它是从「需要申请的实验品」变成「随手可试的组件」的分界线。过去一周开发者已经用 3000 多个仓库表达了兴趣,现在唯一挡住试用的门槛也没了,还附赠 5 美元额度。
如果你正在维护一套靠 LLM 做分类、路由或兜底审查的流水线,值得花半小时把其中一个分支换成 Jev 跑一跑——成本对比几乎是量级差异。只是记得两件事:性能倍数是厂商口径,需要自己验证;以及凡是要算数的地方,别交给它。
消息来源:TypeSafe AI 官方公告(2026 年 9 月 20 日,@typesafeai);TechCrunch 2026 年 9 月 18 日报道;TypeSafe AI 官方文档;模型背景详见站内早前报道《TypeSafe AI 发布 Jev:首个 System One 决策模型,自动化任务最高提速 193 倍》。
相关阅读
围绕 Jev 与 System One 决策模型这条线,站内还有几篇可以接着看:
