SOTA Sync
全部文章
模型进展2026-09-18

TypeSafe:不做聊天,造给机器用的模型

OpenAI RLHF 方向的元老 Diogo Almeida 两年隐身创业,发布 System One Models 和首个模型 Jev:输出类型化决策而非字符串,快两个数量级,且数学上不可能有类型错误。

模型在聊天上早就超人,但自动化在哪儿?这是 Diogo Almeida 过去四年的驱动问题——他在 OpenAI 参与构建了让语言模型学会听从指令、与人对话的方法,那部分工作最终成了 ChatGPT 背后的研究。当时他以为 chat 模型可能通向 AGI,但很快意识到缺了很大一块。

隐身两年、无数技术难题和研究突破之后,TypeSafe AI 发布了第一类新模型:System One Models ——为"让软件直接使用"而生的前沿模型,做的是快速、结构化的决策。首个公开模型 Jev 今日开启早期访问。

#一个为自动化从头搭的技术栈

System One 换掉了整套东西:新模型架构、为效率而生的并行采样器、以及名为 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习) 的新训练算法。

与现有 LLM 的对照(原文表格的浓缩版):

现有 LLMSystem One / Jev
训练方式RLHF / RLVRRLCD
优化目标人类偏好 / 可程序化验证的输出校准决策:带认知诚实的概率
输出字符串 ——灵活但什么都可能是:回答、代码、幻觉、拒答;软件要用还得解析+验证类型化的结构化值 ——输出空间预先定义,数学上不可能类型错误 ,每个答案带校准概率和置信分
采样逐 token 串行生成单次查询并行产出全部输出
成本输入 $0.2–10/MTok,输出约 5 倍输入 $0.042/MTok,输出免费 (便宜到不值得计量)
延迟前沿模型端到端 3–329 秒70–500ms ,同智能水平下快 40–200 倍
置信度让它自报也会过度自信、不稳定;能做对 95% 但不说哪次是 5%,就没法自动化每次输出都带校准置信度,越高越准,相似输入给相似答案
适用场景人在回路(chatbot、copilot、coding agent)、可验证问题(数学证明、kernel 优化)、demo工作流里的"智能 if 语句"(分类/路由/打分/抽取/分支)、对大数据做 map-reduce、实时应用、给 LLM 输出当评分/护栏/越狱检测的验证层

一句话概括 Jev 的形态:一个前沿智能水平的函数调用 ——非结构化状态进,带概率的类型化决策出。

#证据与诚实的 nuance

作者在每个大胆声明后面都附了 nuance 段,这点本身值得记录:

  • 速度/成本 :单次调用真的这么快(但评测是在西海岸笔记本上跑的);定价透明,无法证明没有补贴,可持续性要时间来证。
  • 类型零错误 :不是实测数据,是数学保证——schema 匹配是构造出来的,所以他们敢直接画 0%。
  • 并排 demo :Jev 并行输出全部概率,LLM 逐 token 生成。公开了真实查询链接供早期用户验证;坦承输入被刻意做短做密,对己方模型有利;与 GPT-5.6 Terra 唯一分歧在"流失可能性"一项,答案本身确实模糊。
  • workflow evals :这是他们自造的新评测——不给标准答案分类,也不让 harness 和模型自由变,而是固定一个正确的计算图(workflow),拿最强大最贵外部模型(Astra 和 Fable)的平均预测当参考概率。Jev 在帕累托前沿上领先近两个数量级。诚实声明:workflow 由自家模型能力团队编写,可能有偏;用 OpenAI/Anthropic 模型均值当参照系,反而可能低估了自己和 DeepSeek 系模型。193.6 倍快、444.6 倍便宜就是从这里来的,作者也说这属于真实收益的偏高端。
  • 幻觉与类型安全 :本质同一件事,而类型安全是自动化的入场券——agent 里幻觉一次工具调用是不便,埋在有延迟保证的系统里或依赖链深处就是致命。现有模型无论多聪明,都会幻觉、都会类型错误。

#两个好玩的 demo

  • Doom :用代码 + AI 做实时智能,每秒 10 次查询(约 $7/小时)让 bot 玩游戏。目前是结构化状态数据(还不是图像);非 AI bot 其实能打得更好,但重点是 bot 能响应游戏状态的不同表示、还能听懂指令。
  • Wikiracing :从某个维基页面只靠链接走到目标页面,每步在几百到上千个链接里选——展示的是每秒智能密度,加上高基数选择下不幻觉的复利优势。Jev 支持最高 255 的基数,超过就走"先独立打分再显式选择"的两段式。

#名字的讲究

System One 致敬 Kahneman《思考,快与慢》的快思考/慢思考之分——他们也注意到"System 1"暗含易错,但认为这条路线的模型能做得比替代方案更可靠(理由以后再讲)。

Jev 纪念 William Stanley Jevons:蒸汽机效率提升反而让煤炭需求暴涨(杰文斯悖论)。他们的赌注是同一个——智能每便宜一个数量级,就会解锁数量级更多的使用场景

#怎么看这件事

这篇文章的潜台词是对整个行业方向的批评:RLHF 优化的是人类偏好,造出了超人的指令跟随者,也造出了 mode dropping、过度自信、不可靠这些结构性缺陷——所以 LLM 永远需要人在回路。TypeSafe 的判断是:自动化缺的不是更聪明的模型,是一个软件可以依赖的接口

如果校准置信度这个 claim 在第三方评测里站住,影响会很实际:今天大量"LLM 当 if 语句用"的胶水场景(分类、路由、审核、评分、护栏)都在为一个通用文本生成器付出串行采样的税。一个只输出类型化决策、自带概率、毫秒级返回的模型,正好是这块市场的形状。