Jev 全面开放:TypeSafe 取消等待名单,注册送 $5 额度约 1.2 亿 Token

结论先行:TypeSafe AI 于 2026 年 9 月 20 日宣布,其旗舰模型 Jev 正式面向全体开发者开放——取消等待名单,新注册账号直接获得 5 美元免费额度。按官方输入价 0.042 美元/百万 Token 折算,这 5 美元约等于 1.2 亿 Token 的调用量。一个把「机器决策」当成独立品类来做、并且拒绝生成任何文字的模型,从今天起不再需要申请就能上手。

这也是 Jev 从 Early Access 走向 GA 的一步。此前开发者必须提交申请、等待审批才能拿到 API Key;现在注册即用。

先回顾:Jev 是一个「不写字」的模型

大模型默认的工作方式是自回归地预测下一个 Token,直到生成一段文本。Jev 明确拒绝这份工作说明书:它读取一段非结构化状态(工单、邮件、diff、转录文本等),对着预先定义好的问题集合,返回类型化的答案 + 校准过的概率,一个字的自由文本都不输出。

TypeSafe 把它归类为 System One Model——取名自「思考,快与慢」里那套快速直觉系统,对应的场景就是软件里那些高频、琐碎但必须做的判断:分类、路由、打分、分流、兜底审查。

模型名 Jev 来自经济学家 William Stanley Jevons,即那个「越便宜用得越多」的杰文斯悖论;公司 CEO Diogo Almeida 是前 OpenAI 研究员,参与过 ChatGPT 与 RLHF(基于人类反馈的强化学习)的早期工作。

全面开放后,到底变了什么

维度 Early Access 阶段 全面开放后
接入方式 需提交申请、等待审批 注册即可用,无等待名单
新用户额度 无明确免费额度说明 5 美元免费额度,约 1.2 亿 Token
定价 0.042 美元/百万输入 Token 维持不变,输出 Token 免费
模型版本 jev-preview 等预览别名 jev-1.13.0(jev-latest 指向它)
接口 早期形态未完全固定 固定单一端点 POST /v1/systemone

值得注意的是「输出 Token 免费」这件事为什么成立:Jev 根本不产生输出 Token。它返回的只是预定义答案空间上的概率分布,体量小到可以直接定价为零。这也是它能把成本压下来、并且从结构上杜绝「编造事实」的原因——模型无法输出它没被允许输出的内容。

三种问题类型就是全部词汇表

Jev 的接口词汇非常小,只有三种题型,可以在一次请求中混用、并行独立评估:

类型 作用 返回
Choice 从多个候选项里挑一个(官方声明基数上限 255) 选中的项 + 每个选项的概率
Score 按有序等级打分 得分 + 每个等级的概率
Noul 判断某陈述是否成立 0 到 1 之间的概率

调用形态大致如下(官方 SDK 为 Python 与 TypeScript 两套):

from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

client = TypeSafeClient(model="jev-1.13")

result = client.system_one(
    {"ticket": ticket_text},
    {
        "refund": Noul(instructions="Is the customer asking for a refund?"),
        "team": Choice(options=["billing", "shipping", "engineering"]),
        "mood": Score(levels=["calm", "annoyed", "furious"]),
    },
)

落到 HTTP 层面就是一个端点:

curl -X POST https://api.typesafe.ai/v1/systemone \
  -H "Authorization: Bearer $TYPESAFE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "state": "Help! My payouts have been failing for 3 days.",
    "model": "jev-latest",
    "questions": {
      "is_urgent":  {"type": "noul",   "instructions": "Does this convey urgency?"},
      "department": {"type": "choice", "instructions": "Which team should handle this?",
                     "options": ["billing", "shipping", "engineering"]}
    }
  }'

关键在「校准」二字。TypeSafe 用一套叫 RLCD(Reinforcement Learning for Calibrated Decisions) 的方法训练,借助 Brier score 这类恰当评分规则对齐可验证的真值,目标是:当 Jev 报出 85% 置信度时,它大约 85% 的情况下是对的。这一点直接决定了工程上能不能用阈值来分流——高置信度自动执行,中间区间人工复核,低置信度转人工。

成本怎么算:一百万张工单约 21 美元

定价是这轮讨论的焦点。输入 42 美元/十亿 Token,即 0.042 美元/百万 Token,输出免费。按这个单价做一个算例:

项目 数值
单张工单平均输入 约 500 Token
总量 100 万张 × 500 = 5 亿 Token
输入费用 5 亿 ÷ 100 万 × 0.042 ≈ 21 美元
输出费用 0 美元

同一层级的分类型任务如果用前沿大模型来做,成本会是另一个量级。除了单价,另一笔隐性收益来自结构本身:输出是类型化的,代码可以直接读取,不需要再写一层 JSON 解析与容错兜底——那层「防解析失败」的样板代码,本身就是延迟与故障的来源。

性能数据要看清口径

官方给出的区间是:端到端 70–500 毫秒(典型约 150 毫秒),在 TypeSafe 自己定义的 System One 任务上比前沿通用模型快 40–200 倍、便宜 40–400 倍。更具体的一组演示数据是 0.114 秒对 8.566 秒、0.000081 美元对 0.013880 美元;TypeSafe 称其输入成本比 Claude Fable 5.1 低 238 倍。

需要如实说明的是:这些数字全部来自 TypeSafe 自建评测,官方在发布时也承认参考真值取自 GPT-6 Astra 与 Fable 5.1 输出的平均。目前尚无第三方独立复现,官方文档里也没有公布准确率数字。另外限流为 250,000 Token/秒与 1,200 请求/分钟,官方注明这两个数值可能会随时调整。

生态接入情况

Jev 本身是闭源的托管 API,不提供权重,所有账号使用同一套权重,也不能微调——要引导它只能靠 state 内容和问题措辞。接入渠道目前包括:自有的 Python SDK(pip install typesafe-sdk)与 JavaScript/TypeScript SDK(@typesafe-ai/sdk)、Vercel AI Gateway(模型标识 typesafe-ai/jev)、Cloudflare Workers AI(typesafe/jev)。官方还放出了一个开源适配器,可以把普通 LLM 包装成同样的 System One 接口,方便在做替换对比时保持调用层不变。

热度方面,据媒体报道,Jev 发布后 5 天内开发者已建起 3000 多个 GitHub 仓库做探索;发布当天流量过大还出现过短暂的 API 抖动。

它做不了什么:使用前必须知道的边界

  • 不生成文本:不能聊天、写稿、写代码,工作说明书里没有这一项。
  • 不能算术:官方文档明确指出,Jev 无法计数、比较日期或做算术运算。
  • 只吃文本:不支持图像、音频、视频输入。
  • 上下文 64k:其中 state 与最长问题合计上限 32k,约 15 万字符。
  • 非英语能力较弱:以英语为主,中文、日文等 CJK 输入可以接受,但官方文档称「目前准确率较低」。
  • 无参数公开:参数量未披露,Closed API,不可自部署。

定位上它不是推理模型的替代品,而是一个组件。最典型的用法是「便宜快速的校准门卫」:放在昂贵模型前面,判断这次请求要不要动用大模型、生成结果是否安全可发布、这份文档该进哪条流水线。这其实是一种双速架构——高频低价值的判断下沉到专用小模型,深度推理留给真正需要的地方。

常见问题(FAQ)

Q1:现在注册要花钱吗?

不需要。取消等待名单后直接注册即可,新账号赠送 5 美元额度,按 0.042 美元/百万输入 Token 折算约合 1.2 亿 Token,足够完成一轮完整的业务验证。

Q2:Jev 能替代我现在的分类模型或正则规则吗?

可以覆盖很大一部分,但要看任务性质。如果判断对象是自然语言、且需要概率化的置信度来分流,Jev 比手写规则更稳;如果只是字符串匹配或纯数值判断,继续用规则更划算。注意它不能做算术,涉及金额计算、日期比较的逻辑必须留给代码。

Q3:中文场景能用吗?

可以用,但要留出准确率折扣。官方文档说明 CJK 输入目前准确率偏低,建议先用自有中文样本跑一轮评测,再决定是否把阈值分流逻辑接进去。

小结

「取消等待名单」这个动作本身看起来不大,但对 Jev 这类定位特殊的模型来说,它是从「需要申请的实验品」变成「随手可试的组件」的分界线。过去一周开发者已经用 3000 多个仓库表达了兴趣,现在唯一挡住试用的门槛也没了,还附赠 5 美元额度。

如果你正在维护一套靠 LLM 做分类、路由或兜底审查的流水线,值得花半小时把其中一个分支换成 Jev 跑一跑——成本对比几乎是量级差异。只是记得两件事:性能倍数是厂商口径,需要自己验证;以及凡是要算数的地方,别交给它。

消息来源:TypeSafe AI 官方公告(2026 年 9 月 20 日,@typesafeai);TechCrunch 2026 年 9 月 18 日报道;TypeSafe AI 官方文档;模型背景详见站内早前报道《TypeSafe AI 发布 Jev:首个 System One 决策模型,自动化任务最高提速 193 倍》。

相关阅读

围绕 Jev 与 System One 决策模型这条线,站内还有几篇可以接着看: