BLOG

技术拆解 015|Jev:不会聊天的模型,和围绕它的两种赌注

永亮
JevTypeSafe AIRLCDSystem One模型分类
广告 · Advertisement

技术拆解:解析 AI 技术框架——说明、分析、技术评估、价值判断、落地使用。作者:永亮


9 月 15 日,TypeSafe AI 发布 Jev;18 日,TechCrunch 说开发者为之疯狂。发布第一周,官网被流量打爆过一轮,Hacker News 上吵了四五百楼,Vercel、Cloudflare、LangChain 接连官宣接入。但吵归吵,说明白它到底是什么的文章不多——大量内容停在「193 倍快、444 倍便宜」这类倍数上,机制和路径反而没人细讲。

这篇尽量讲清楚:Jev 是什么、它凭什么快、那些倍数怎么读、四天里接入方长成了什么样、普通人怎么上手,以及——不买它的话,这套思想怎么搬回自己的系统。

一、Jev 是什么:一台只输出判断的机器

Jev 是 transformer 架构,但不是 LLM。它不生成任何文本——没有寒暄,没有解释,也没有代码。你喂给它一段文本(官方叫 state,可以是字符串、JSON、文本数组),再附上一组预先定义好的问题,它返回的是类型化的答案加概率。

答案只有三种形状:

  • Noul:是非题,返回 0 到 1 的概率。「这条消息在要求退款吗」→ 0.95。
  • Choice:单选题,返回选中的选项,外加每个候选的概率。「工单归哪个团队」→ billing;billing 0.87 / technical 0.13 / sales 0。
  • Score:量表题,返回分数和各档位概率。「客户有多恼火」→ 1.04(0 平静 / 1 恼火 / 2 暴怒),各档概率 0 / 0.96 / 0.04。

每个答案还附带一个 confidence 字段。概率回答「这个选项多可能是对的」,置信度回答「模型对自己多确定」——两个字段都能在代码里取值,这是它全部玩法的基础。

TypeSafe 把 Jev 归入一个新类别:System One,名字借自卡尼曼《思考,快与慢》里的系统一——快速、直觉的判断。官方对外的定义刻意说得很大:System One 模型不是给你聊天用的,是给软件调用的。CEO Diogo Almeida 是 RLHF 和 InstructGPT 的共同发明人,OpenAI 前研究员,公司官网挂着他的一句话:模型聊天早就超人了,自动化在哪?他离开 OpenAI 两年,交出的不是更强的聊天模型,而是这台只会判断的机器。

训练方法官方叫 RLCD(reinforcement learning for calibrated decisions,校准决策强化学习),他们把后训练技术划成三条路线:RLHF 把模型训成人类喜欢的聊天对象,RLVR 把模型训成会推理的解题机器,RLCD 只关心一件事——判断得准,并且概率诚实。校准的定义:模型说 0.2,大量同类判断里事情真的发生约 20%。注意这是组属性,官方文档自己写明不保证单次正确。

模型名致敬 19 世纪经济学家威廉·斯坦利·杰文斯。杰文斯悖论说的是:蒸汽机效率提升没有减少煤炭消耗,反而让用煤的地方多到想不到。Almeida 给模型起这个名字,赌的就是同一件事——判断的成本降两个数量级之后,软件里会冒出成千上万现在根本不存在的判断点。这是商业叙事,先记住它。

公司层面再补两笔。9 月 15 日出 stealth 当天宣布 4000 万美元种子轮,DCVC 领投;Forbes 在同日报道里直接把它称作一家两亿美元的初创公司。CTO Erik Gafni 是连续创业者,COO Sasha Sheng 出自 Meta FAIR。发布当周需求高到 API 一度接不住,TechCrunch 报道标题里出现了「让开发者疯狂」这种词——情绪已经拉满,所以后面所有数字都要拆开看,先讲机制,再讲数字。

二、它凭什么快:并行采样器和「输出免费」

Jev 的快不靠玄学。官方博客披露了两件架构层面的事。

第一是并行采样。LLM 是串行生成的:一个 token 一个 token 往外蹦,每个都依赖前一个,生成三百个 token 就要三百步,端到端响应时间按秒算——官方博客里给的前沿模型区间是 3 到 329 秒。Jev 放弃字符串生成之后,采样器换成了并行的:一次查询里把所有答案同时算出来,官方原话是 hardware-aware 的并行采样器。再叠加所有问题对同一份 state 并行评估,一次调用问五十个问题和问五个的耗时几乎一样。

第二是计费结构。输入每百万 token 0.042 美元,输出免费——官方的原话是「too cheap to meter」,便宜到不值得计量。因为输出只有几十个结构化的概率值,成本确实趋近于零。对比之下,主流 LLM 输入每百万 token 0.2 到 10 美元,输出还要再贵约五倍。

把这两件事放在一起,Jev 的成本模型就清楚了:你只为「让它读」付钱,不为「让它答」付钱。官方给的端到端延迟区间是 70 到 500 毫秒,同一任务相比前沿 LLM 的提速口径是 40 到 200 倍。模型当前线上版本是 jev-1.13.0,API 提供 jev-latest 和 jev-preview 两个别名,会随版本滚动更新——官方文档明确建议生产环境钉死版本号,别追别名。对高频小判断——每条评论、每张工单和每个工具调用——这个定价结构比任何 benchmark 都更能说明问题。

三、那些倍数怎么读:数字的修辞学和数字的数学

先把官方口径摆全:新闻稿写延迟低于 100 毫秒;发布材料写 70 到 500 毫秒;官网首页宣称比对比模型快 193.6 倍、便宜 444.6 倍;官方博客的克制版本是「快 40 到 200 倍」。

读这些数字要分两层。修辞学的一层:193.6 和 444.6 这两个精确到小数点的数字,出自公司发布的一份自评报告,四个对比 workflow 由自家能力团队设计,官方技术说明里自己承认可能偏高、结果大概率在真实分布的高段;基准没有标准答案,对照组是两个外部大模型平均概率的包装版本。TechStock² 的核查说得直白:这些数字该读作营销上限,不是中位数。越是长得不像四舍五入的数字,越要问一句它是怎么算出来的——这个习惯对所有厂商的 benchmark 都适用,不只 TypeSafe。

数学的一层:哪怕把倍数全部打对折再打折,「输出免费、输入按亿 token 计价、无串行生成」的结构差异,决定了高频判断场景的成本天然比「LLM 生成几百 token 再解析 JSON」低一到两个数量级。这个不依赖任何 benchmark,是计费的算术。

第三方信号也在进来。Vercel 工程师对 TechCrunch 说,公司审查命令安全性的分类器从 OpenAI 换成 Jev 后,速度快 5 到 18 倍,准确率还更高。Bryo AI 的 CTO 拿 Jev 和 Gemini 做邮件分类对比:Gemini 准确率略高,但成本高 10 到 20 倍;真正打动他的是 Jev 是唯一能返回真实概率的。Pi 的作者 Armin Ronacher 的评价最冷静:幻觉没有消失,而是变成了调用方可以编程处理的数据——50% 概率当抛硬币,95% 才自动执行。他还点了一个很值钱的方向:拿 Jev 监控 agent 行为、做模型路由,这两件事用 LLM 干太贵,用这个价格才成立。

最后看官方自己的坦率。TypeSafe 维护一份 jaggedness 文档,主动列出 jev-1.13 的九条已知短板:逐字阅读问题(答你写的,不是你想的);计数不可靠(认答案的形状,不真的在数);日期比较、多跳推理偏弱;大 state 里塞无关细节会稀释判断;对抗性内容和自相矛盾的标准会出错;需要生成或解释的任务,官方直接建议改用生成模型。中文输入支持,但官方明示准确率低于英文。截至 9 月 20 日模型还是早 access 制,融资公告没有披露收入和客户数。

四、四天里,接入方长成了什么样

这次发布最值得看的,是接入方跟进的速度,可以说验证了「需求真实」这个判断。

官方渠道之外,接入方三天内凑齐了三大云和主流框架:Vercel 工程师公开了替换案例;Cloudflare 把 typesafe/jev 收进自家 AI 模型目录,Workers AI 里一行 env.AI.run 就能调;LangChain 官方在 17 日发了博客,标题就叫《用 Jev 搭一个 harness》,把 Jev 塞进 agent 循环里做行为评估——agent 每做一个决策都要一次模型调用,太贵,用 Jev 做监控层,成本才成立。OpenRouter 同步上架,没有 waitlist 的开发者可以从这拿到访问。

开源社区更直接:Claude Code 插件 fast-jev-compaction 9 月 17 日创建,用 Jev 给每条工具调用和结果打分决定上下文去留,四天冲到 4340 个 star。中文社区的反应速度也不慢:GitHub 上出现了 NanmiCoder/jev-arena,一个「Jev 对 DeepSeek」的评论打标对决场,导入一万条 CSV,两边同时开跑,左边 Jev 的处理进度条把右边的 deepseek-flash 甩开肉眼可见的差距,跑完还能导出双份报告回放——这是目前中文圈最直观的 Jev 实测素材,而且全部数据和报告都公开可复核。

关于 Jev 的讨论热度已经不缺,缺的是一条能走通的上手路径。所以接下来这部分专门讲路径。

五、怎么参与进去:四条路,按门槛从低到高

第一条,零门槛围观:去 GitHub 拉 NanmiCoder/jev-arena,本地跑起来,用演示数据看 Jev 和 deepseek-flash 在同样一万条评论上的速度差,回放不花一分钱也不需要 key。这一步不值钱,但值得做——先用自己的眼睛确认差距是不是真存在。

第二条,低成本试真:Jev 的 Decisions 是独立协议,不是 Chat Completions,但 OpenRouter 已经封装好,申请一个 OpenRouter key 就能调 typesafe/jev-1.13,jev-arena 默认就走这条路。vibe coding 的教程在中文社区已经开始长出来,跟着做完一个分类场景,成本大概几美分。

第三条,进生产前评估:如果候选场景跑在 Workers 上,Cloudflare 的接入是最短路径;如果是 Python 或 agent 框架,LangChain 的 langchain-typesafe 封装了 TypeSafeClassifier,state 和 questions 传给 invoke() 拿回分类结果。官方 SDK 装在 pip install typesafe-sdk,环境变量 TYPESAFE_API_KEY,默认模型别名 jev-latest。注意配额:当前版本限流 25 万 token 每秒、1200 次每分钟,单请求 64k token,state 加最长问题不超过 32k,配额是动态的,接入前看一眼文档。

第四条,走正门:typesafe.ai 官网申请 waitlist。早 access 期间模型对所有账户用同一套权重,官方承诺不分客户微调、不用用户数据训练,企业版可以谈零数据保留。

算一笔账更直观。一万条评论打标,平均每条上下文三百 token,总共三百万 token,按 Jev 的输入价是 0.126 美元,输出免费;同样的量交给一个输出价五倍于输入价、每条要生成几十 token 的主流 LLM,账单大约高出一到两个数量级,时延从毫秒级变成秒级,还要为解析失败预留重试。jev-arena 那台对决场把这件事做成了可视化:左边 Jev 的进度条跑完时,右边 deepseek-flash 才处理到零头——单次运行不代表统计结论,但账是可以自己算的。四条路对应四种目的:看热闹、验真假、做集成、谈合作。别一上来就走第四条。

六、把这套思想搬回家:判断与生成分离

即使 Jev 本身你暂时用不上,这套架构思想也值得拆下来搬回自己的 LLM 应用里,因为它本质上是一个接口设计问题。

穷人版 Jev 的做法:继续用你现有的 LLM,但把判断类调用从「自由生成加 JSON 解析」改成「受限输出加概率校准」。举个具体例子:判断工单是否紧急,别再让模型输出一段 JSON 再解析,把输出空间压成「紧急/不紧急」两个 token 的二选一,取首 token 的 logprob 当概率,再用自己攒下的历史工单跑两周,做一层校准回归——isotonic 或 Platt 都行。形状立刻稳定,解析重试消失,概率也能看了。成本降不下来多少,但接口的可靠性是实打实的提升,这一步今天就能做,不需要任何新供应商。

进阶版是蒸馏。官方 cookbooks 里自己就有这个思路:拿 Jev 的选项加概率当教师信号,训一个经典分类器或者小模型,把成本再砍一到两个数量级,时延压进十毫秒级。判断任务的数据分布一旦稳定,这条路几乎是必然的终点。

更深一层的启发是 Almeida 那句追问:模型聊天早就超人了,自动化在哪?他赌的答案是:自动化卡住的地方不是模型不够聪明,而是判断没有成为软件的原语。代码需要类型、概率、确定性时延,聊天模型给的是字符串。Jev 把「判断」从生成里拆出来做成一等公民,不管这个赌注最终兑现几成,「按接口形状选模型」这个思路,大概率是未来两年 AI 工程的主线之一。

结论

Jev 值得认真看,不值得照单全收。它真实的部分:架构层面放弃串行生成换来数量级的时延和成本优势,判断加校准概率的接口对自动化是真有用,接入方跟进的速度——三大云、主流框架、开源插件、中文社区的实测工具四天之内全部到位——验证了需求是真的。要打折的部分:官网那些精确到小数点的倍数全是自测,模型还在早 access,九条短板条条见血,中文场景官方自己都说弱,校准是组属性不是单条的保证。值不值得参与,取决于你的系统里有多少判断正在被一个聊天模型昂贵地硬扛。审计一下自己生产环境里的 LLM 调用清单,把「其实在要一个判断」的调用挑出来——无论最后选不选 Jev,这张清单本身就是这篇文章最值钱的产出。


参考来源

  1. TypeSafe 官方博客:Introducing System One Models & Jev(2026-09-15,Diogo Almeida 亲笔)
  2. TypeSafe 官方文档:System One、Noul、Composite Scoring、Jaggedness(jev-1.13)、Models、FAQ、Legal
  3. TypeSafe AI 团队页与 Manifesto(typesafe.ai)
  4. Business Wire:TypeSafe AI Emerges from Stealth(2026-09-15)
  5. TechCrunch:A new kind of AI model from a ChatGPT inventor is driving developers wild(2026-09-18)
  6. The Register:TypeSafe debuts Jev(2026-09-16)
  7. TechStock²:TypeSafe’s 193.6× / 444.6× claims(2026-09-17)
  8. LangChain 官方博客:Building a Harness with Jev(2026-09-17)
  9. Cloudflare AI 模型文档:typesafe/jev
  10. GitHub:joelhooks/fast-jev-compaction(Claude Code 插件,09-20 数据 4340★);NanmiCoder/jev-arena(Jev 对 DeepSeek 评论打标对决场)
  11. OpenRouter 模型页:typesafe/jev
广告 · Advertisement

常见问题

Jev 和 LLM 的本质区别是什么?

LLM 逐 token 串行生成自由文本;Jev 用并行采样器一次调用同时评估所有候选答案,只输出固定类型的概率答案。输入每百万 token 0.042 美元、输出免费,端到端延迟 70-500 毫秒,适合高频判断场景。

官方宣称的快 193.6 倍、便宜 444.6 倍可信吗?

这两个数字出自公司自评报告,官方自认偏高;第三方实测为 5-18 倍提速、比 Gemini 便宜 10-20 倍但精度略输。更稳妥的预期区间是快 10-50 倍、便宜一到两个数量级。

普通开发者现在怎么上手 Jev?

按门槛四条路:本地跑 GitHub 上的 jev-arena 对决场围观实测;申请 OpenRouter key 调 typesafe/jev-1.13;在 Cloudflare Workers AI 里用 env.AI.run 集成;或到 typesafe.ai 官网申请 waitlist。