前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 本周发布新模型 Jev。与主流大语言模型不同,Jev 不生成文本,而是直接输出概率结果,目标是让模型更适合软件自动化,而不是继续围绕自然语言交互展开。
不再以文本为输出
Almeida 曾参与 ChatGPT 和 RLHF 的研发。他对 TechCrunch 表示,现有模型虽然擅长人类语言,但这并不等于适合自动化系统。因为软件和计算机处理的是更明确的结构化信号,而不是开放式文本。
Jev 采用 transformer 架构,但公司称它不是大语言模型。它的输出由用户预先定义,因此不会像聊天模型那样生成自由文本,也减少了“幻觉”问题。按照 TypeSafe AI 的说法,这种设计还带来更低的推理成本和更快的响应速度。
开发者开始用于分类和审查

Jev 发布后很快吸引开发者测试。由于请求量过高,TypeSafe AI 的 API 一度短暂承压。当前最明确的应用方向,是把它作为软件流程中的分类器、判断器或安全检查模块。
Vercel 工程师 Pranit Sharma 表示,公司曾使用 OpenAI 的模型审查指令安全性,后来换成 Jev 后,处理速度提升约 5 倍到 18 倍,准确性也有所改善。另一家 Bryo AI 的技术负责人 Nikhil Mudholkar 在商业邮件分类测试中发现,Gemini 的准确率略高,但成本比 Jev 高出 10 倍到 20 倍。
Jev 另一个受到关注的点,是它会返回置信度分数。开发者可以据此决定是否执行某个自动化动作,而不是把模型输出直接当作确定答案使用。
可作为大模型的辅助判断层
除了替代部分大语言模型场景,Jev 也被视为一种辅助层。开发者可以把它接在智能体系统之外,用来监控模型行为、检查异常输出,或判断某项任务是否需要调用更昂贵的模型。
开源模型工具 Pi 的开发方 Earendil 首席技术官 Armin Ronacher 表示,这类模型的价值在于,它能给出更接近真实概率的结果。比如当返回概率只有 50% 时,系统可以选择忽略;如果达到 95%,再继续执行后续动作。
Ronacher 还提到,Jev 适合做模型路由,也就是先判断某个请求是否真的需要调用特定模型。由于这类判断本身需要实时完成,低成本和低延迟就变得更重要。
TypeSafe押注合成数据训练
TypeSafe AI 对 Jev 的底层细节披露不多。外部观察者猜测,它可能建立在开源权重模型之上。公司则将 Jev 称为“System One model”,强调它更偏向直觉式判断,而不是复杂推理。
Almeida 表示,Jev 完全使用合成数据训练,并采用一种名为“基于校准决策的强化学习”的方法。TypeSafe AI 计划继续推出更多版本,并扩展到新的模态。
从当前反馈看,Jev 的吸引力主要不在于替代所有聊天模型,而是在更窄、更明确的自动化任务中,用更低成本提供可执行判断。如果这一方向被更多开发者接受,AI 模型的应用形态可能会进一步从“对话”转向“嵌入式决策”。











