模型在聊天上早就超人,但自动化在哪儿?这是 Diogo Almeida 过去四年的驱动问题——他在 OpenAI 参与构建了让语言模型学会听从指令、与人对话的方法,那部分工作最终成了 ChatGPT 背后的研究。当时他以为 chat 模型可能通向 AGI,但很快意识到缺了很大一块。
隐身两年、无数技术难题和研究突破之后,TypeSafe AI 发布了第一类新模型:System One Models ——为"让软件直接使用"而生的前沿模型,做的是快速、结构化的决策。首个公开模型 Jev 今日开启早期访问。
#一个为自动化从头搭的技术栈
System One 换掉了整套东西:新模型架构、为效率而生的并行采样器、以及名为 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习) 的新训练算法。
与现有 LLM 的对照(原文表格的浓缩版):
| 现有 LLM | System One / Jev | |
|---|---|---|
| 训练方式 | RLHF / RLVR | RLCD |
| 优化目标 | 人类偏好 / 可程序化验证的输出 | 校准决策:带认知诚实的概率 |
| 输出 | 字符串 ——灵活但什么都可能是:回答、代码、幻觉、拒答;软件要用还得解析+验证 | 类型化的结构化值 ——输出空间预先定义,数学上不可能类型错误 ,每个答案带校准概率和置信分 |
| 采样 | 逐 token 串行生成 | 单次查询并行产出全部输出 |
| 成本 | 输入 $0.2–10/MTok,输出约 5 倍 | 输入 $0.042/MTok,输出免费 (便宜到不值得计量) |
| 延迟 | 前沿模型端到端 3–329 秒 | 70–500ms ,同智能水平下快 40–200 倍 |
| 置信度 | 让它自报也会过度自信、不稳定;能做对 95% 但不说哪次是 5%,就没法自动化 | 每次输出都带校准置信度,越高越准,相似输入给相似答案 |
| 适用场景 | 人在回路(chatbot、copilot、coding agent)、可验证问题(数学证明、kernel 优化)、demo | 工作流里的"智能 if 语句"(分类/路由/打分/抽取/分支)、对大数据做 map-reduce、实时应用、给 LLM 输出当评分/护栏/越狱检测的验证层 |
一句话概括 Jev 的形态:一个前沿智能水平的函数调用 ——非结构化状态进,带概率的类型化决策出。
#证据与诚实的 nuance
作者在每个大胆声明后面都附了 nuance 段,这点本身值得记录:
- 速度/成本 :单次调用真的这么快(但评测是在西海岸笔记本上跑的);定价透明,无法证明没有补贴,可持续性要时间来证。
- 类型零错误 :不是实测数据,是数学保证——schema 匹配是构造出来的,所以他们敢直接画 0%。
- 并排 demo :Jev 并行输出全部概率,LLM 逐 token 生成。公开了真实查询链接供早期用户验证;坦承输入被刻意做短做密,对己方模型有利;与 GPT-5.6 Terra 唯一分歧在"流失可能性"一项,答案本身确实模糊。
- workflow evals :这是他们自造的新评测——不给标准答案分类,也不让 harness 和模型自由变,而是固定一个正确的计算图(workflow),拿最强大最贵外部模型(Astra 和 Fable)的平均预测当参考概率。Jev 在帕累托前沿上领先近两个数量级。诚实声明:workflow 由自家模型能力团队编写,可能有偏;用 OpenAI/Anthropic 模型均值当参照系,反而可能低估了自己和 DeepSeek 系模型。193.6 倍快、444.6 倍便宜就是从这里来的,作者也说这属于真实收益的偏高端。
- 幻觉与类型安全 :本质同一件事,而类型安全是自动化的入场券——agent 里幻觉一次工具调用是不便,埋在有延迟保证的系统里或依赖链深处就是致命。现有模型无论多聪明,都会幻觉、都会类型错误。
#两个好玩的 demo
- Doom :用代码 + AI 做实时智能,每秒 10 次查询(约 $7/小时)让 bot 玩游戏。目前是结构化状态数据(还不是图像);非 AI bot 其实能打得更好,但重点是 bot 能响应游戏状态的不同表示、还能听懂指令。
- Wikiracing :从某个维基页面只靠链接走到目标页面,每步在几百到上千个链接里选——展示的是每秒智能密度,加上高基数选择下不幻觉的复利优势。Jev 支持最高 255 的基数,超过就走"先独立打分再显式选择"的两段式。
#名字的讲究
System One 致敬 Kahneman《思考,快与慢》的快思考/慢思考之分——他们也注意到"System 1"暗含易错,但认为这条路线的模型能做得比替代方案更可靠(理由以后再讲)。
Jev 纪念 William Stanley Jevons:蒸汽机效率提升反而让煤炭需求暴涨(杰文斯悖论)。他们的赌注是同一个——智能每便宜一个数量级,就会解锁数量级更多的使用场景 。
#怎么看这件事
这篇文章的潜台词是对整个行业方向的批评:RLHF 优化的是人类偏好,造出了超人的指令跟随者,也造出了 mode dropping、过度自信、不可靠这些结构性缺陷——所以 LLM 永远需要人在回路。TypeSafe 的判断是:自动化缺的不是更聪明的模型,是一个软件可以依赖的接口 。
如果校准置信度这个 claim 在第三方评测里站住,影响会很实际:今天大量"LLM 当 if 语句用"的胶水场景(分类、路由、审核、评分、护栏)都在为一个通用文本生成器付出串行采样的税。一个只输出类型化决策、自带概率、毫秒级返回的模型,正好是这块市场的形状。