Jev:一个不说话的 AI 模型,为什么让14万开发者疯狂?

Jev:一个不说话的 AI 模型,为什么让14万开发者疯狂?

Author: rudeng | Create: 2026-09-22 10:30:05 | Update: 2026-09-22 10:30:05 | 分类:大模型

AgentJevTypeSafe AI决策模型System OneRLCDDiogo AlmeidaAPUS

9月15日,一个名叫 Jev 的 AI 模型在硅谷开发者社区突然刷屏。它不写文章、不写代码、不能聊天——主动砍掉了大模型最重要的能力:生成文本。

TypeSafe 给它的定义只有一句话:"Decisions, not strings"——要决策,不要文本。

给它一段信息和几个预定义问题,它直接返回选择、评分和概率。上线不过数天,14万开发者涌入内测,GitHub 上涌现近500个开源项目。这可能是 OpenClaw 之后最让人兴奋的新项目。

本文带你全面了解 Jev 到底是什么、为什么火、以及它可能如何改变 AI Agent 的架构。

一、Jev 是什么:不做表达的"系统一"模型

Jev 由前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 开发,2026年9月15日发布。它被定位为 "System One Model"(系统一模型),名字来自卡尼曼《思考,快与慢》中的 System 1——快速、直觉式判断。

而"Jev"这个名字则来自经济学家 William Stanley Jevons 以及"杰文斯悖论":一种资源的使用效率提高、成本下降之后,最终需求可能反而增加。 TypeSafe 希望让"智能判断"足够便宜后被大规模嵌入软件。

三种输出类型

Jev 的输出只有三种形状,每种都返回结构化的 JSON:

类型 用途 返回内容 示例
Choice 选择题 选中的选项 + 每个选项的概率 + 置信度 客服邮件应分给哪个部门
Score 评分题 连续值(在开发者定义的区间内)+ 各档概率 退款风险有多高
Noul 是非题 0到1之间的单一值,0.5表示弃权 是否需要人工介入

一次调用可以同时携带多个问题,共享同一段上下文——因为上下文是 Token 消耗的大头,一次问完比分开问更省更快。

零样本,无需训练

传统分类器每增加一类任务都需要重新标注数据、训练模型。Jev 不一样:标签的定义随请求一起发送,开发者凌晨两点改了分类标准,下一次调用立即生效。没有数据集要准备,没有微调要跑,没有模型要部署,没有漂移要监控。

二、为什么火了:Agent 不需要每步都"说话"

今天的大语言模型本质上是 Token 生成机器。以一个电商 Agent 为例,它打开网页后需要判断下一步点击哪个按钮。常见做法是把页面状态交给 GPT 或 Claude,模型理解后逐字生成"根据当前页面,我应该点击右下角的Checkout按钮",软件再从这段文字中提取 Checkout 完成点击。

但从软件系统的角度,它真正需要的信息可能只是"第三个按钮"。

类似的情况在 Agent 内部大量存在:工单应该交给销售还是售后、这笔交易风险高不高、搜索结果哪条最相关。这些任务需要语义理解和判断能力,却没有多少开放式文本生成的必要。

如果 Agent 完成一个任务需要100次模型调用,其中10次需要复杂规划和自然语言生成,剩余90次只是工具选择、结果排序、风险判断和状态检查——全部调用同一种大型生成模型显然存在巨大优化空间。

Jev 在 Agent 架构中的位置

Jev 的目标就是这90次。TypeSafe 希望未来 Agent 系统采用多层模型结构:

  • Frontier Model(前沿模型):复杂规划、推理、自然语言生成
  • Flash Model(轻量模型):普通推理任务
  • Decision Model(决策模型):路由、分类、验证等高频判断
  • 传统代码:确定性逻辑

三、夸张的数字背后

TypeSafe 公布的性能数字确实惊人:

  • 速度:最高比前沿大模型快 193.6倍
  • 成本:最低便宜 444.6倍
  • 延迟:端到端 70—500 毫秒
  • 价格:每百万输入 Token 0.042美元,输出不按 Token 收费
  • 类型错误率0%

但需要理性看待。这些任务本身就是 Jev 最擅长的 System One 型任务,让一个专为结构化决策设计的模型与通用生成模型比赛分类任务,本身就会放大 Jev 的优势。而且评测主要由 TypeSafe 自己设计,可能存在偏差。

"193.6倍"和"444.6倍"是特定任务、特定模型比较中的最大差距,不代表所有任务都有这样的提升。它真正能证明的是一个常识:如果任务最终只需要一个选择或概率,那么专为判断设计的模型确实比完整的生成式 LLM 便宜很多。

一个 Minecraft 的例子

有网友拿 Jev 配合 GPT-6 Astra 在 Minecraft 里打赢末影龙,只用了 8 分 43 秒。总成本不到 1 美元,其中 Jev 花了 0.01 美元,Astra 花了 0.96 美元。完整代码已开源。

四、"零幻觉"到底是什么意思

TypeSafe 官网最醒目的宣传之一是 "Zero Hallucinations"(零幻觉)。这句话容易让人误以为 Jev 解决了大模型的幻觉问题,但它只是能保证输出不会超出预定义类型

比如开发者规定模型只能在"猫、狗、鸟"三个选项中选择,Jev 不会返回"大象",也不会生成一段软件无法解析的文字。这对 Agent 自动调用 API、修改数据库和执行工作流时确实重要——结构化输出越稳定,系统越容易接入后续操作。

类型正确不等于判断正确。如果输入明明是一只猫,模型却返回"狗:97%",它依然没有发生 type error,业务结果却完全错误。

RLCD:概率校准才是真正值得关注的

Jev 更值得关注的是 TypeSafe 提出的 RLCD——Reinforcement Learning for Calibrated Decisions(面向校准决策的强化学习)

  • RLHF 优化人类偏好
  • RLVR 依赖可验证奖励提升数学、代码等能力
  • RLCD 重点解决"模型说自己有多大把握,这个概率到底靠不靠谱"

这对 Agent 进入生产环境尤其关键。如果模型实际正确率只有80%,却经常给出99%的置信度,这个数字几乎无法用于自动化决策。只有当模型说90%置信度时大约90%判断正确,企业才能建立稳定的分流机制:高置信度直接执行,中等置信度交给更强模型复核,低置信度转给人工。

五、开发者生态:36小时14万人涌入

Jev 上线后的生态爆发速度超出预期:

  • 不到36小时,14万开发者涌入内测
  • GitHub 涌现近500个开源项目
  • 有人把它塞进 PostgreSQL(pg-jev)和 DuckDB(duckdb-jev),用自然语言对数据库行数据进行实时概率过滤和排序
  • Ruby 社区有人把判断封装成原生控制流语法
  • 有人用 Jev 打星际争霸
  • 一位开发者只用一个晚上搭起了全自动实时交易机器人(不过亏损了31680美元 😂)

9月21日,Jev 正式向所有人开放,无需候补名单。所有用户初始有 5 美元额度,约 1.2 亿 Token。

六、国产复现:APUS 开源 fast-browser-use

9月19日,中国 AI 企业 APUS 公布了对 Jev 的独立开源复现,包装为开箱即用的 Agent Skill fast-browser-use

  • 支持纯本地模型离线执行(macOS、Linux、Windows)
  • 基于 Qwen3.5-9B,通过单次前向计算完成"点哪里、选哪个"的决策
  • Apple M2 Pro 笔记本上,维基百科检索任务中位耗时约18秒
  • 表单填报、站内导航等任务仅3秒
  • 单任务模型打分仅4次,全程零云端调用、零API费用
  • MIT 协议开源

APUS 复现了 Jev 的核心逻辑:跳过自回归解码、隐状态直接打分,并实现了 KV-Cache 广播与并发批量评估。

七、争议与局限

Jev 并非没有争议,社区讨论非常激烈:

概率校准问题: 有网友在贷款违约、企业破产和医疗诊断等八个真实数据集上测试,发现 Jev 的概率校准明显落后于 CatBoost,且经常高估负面结果。选项顺序也会影响输出概率。

技术透明度不足: TypeSafe 尚未公开完整论文,也未披露参数规模、网络结构、训练数据。外界无法判断 RLCD 究竟是新范式还是已有方法的工程化组合。

应与谁比较: Jev 真正应该比较的对手不只是 GPT、Claude 等昂贵前沿模型,还包括 Flash 小模型配合 JSON Schema、Structured Output 和 Constrained Decoding,以及传统 classifier 和 embedding+classifier。

适用范围有限: TypeSafe 自己也承认,Jev 在算术、计数、日期、字面匹配、对抗性输入和矛盾条件等任务上表现不稳定。

八、为什么这件事值得关注

不管 Jev 最终是否代表了基础架构突破,它提出了一个真实的产业痛点:AI 的"智能"是否一定要通过高资源消耗的语言生成来完成?还有没有更好、更靠谱、更高效的方式?

大模型研究工程师 Sebastian Raschka 认为,简单把 Jev 看成分类器很容易低估它。传统 encoder 分类器服务于固定任务,标签集随训练确定。而 Jev 可以在运行时接收自然语言标签,结合上下文对不同选项评分,更换类别无需重新训练。

这让 Jev 更像一个拥有通用语义理解能力的"智能 if 语句"——不是替代 LLM,而是补上 Agent 架构中缺失的那一层:快速、廉价、类型安全的决策层。

当"智能判断"足够便宜后被大规模嵌入软件,也许杰文斯悖论会再次应验:效率越高,需求越大。


参考资源:

  • Jev 官方 Playground:https://jevx.org/
  • TypeSafe AI 控制台:https://console.typesafe.ai/login
  • APUS fast-browser-use 开源项目(MIT 协议)
  • Minecraft Agent 开源:https://github.com/rmalde/minecraft-agent

评论(0)

暂无评论,来抢沙发~


关于本站 · RSS

浙ICP备2025156991号浙公网安备33010802013816号 浙公网安备33010802013816号 © 2026 智能体工场 - [从善如登] All rights reserved.