上周 AI 圈出了个怪胎。9 月 15 日,一家叫 TypeSafe AI 的公司发布了个叫 Jev 的模型,三天内冲上 Hacker News 榜首(1863 分、491 条评论),卖点离谱到我第一反应是诈骗:
这个模型一个字都不会写。
不是写不好,是压根没有「写字」这个功能。它只会回答三种问题:是或否、从这几个里选一个、打个分。你问它「给我写首诗」,它会礼貌地返回一个类型错误。

这听起来像个残次品,但社区三天的反应说明事情没那么简单。我翻了官方文档、HN 讨论和几篇第三方实测,这篇是给不想啃源码的朋友们的通俗版调研笔记。
它是个只会做选择题的面试官
现在的 AI 模型(GPT、Claude 这些)本质上是「超级自动补全」:一个 token 一个 token 往外蹦字,像个话痨,不管你要的是不是一段文字。你想要个「是」,它可能回你「根据我的分析,这是一个非常值得探讨的问题,综合来看,是的」。谢谢,字数挺足。
Jev 走了完全相反的路:你给它一段材料(比如一条客户投诉),然后只准问选择题:
- 这个投诉该分给哪个部门?(billing / technical / sales)
- 客户愤怒程度几级?(平静 / 有点烦 / 爆炸)
- 这事儿紧急吗?(是 / 否)
三种问题可以混在一次请求里,它一次性全部答完,每个答案还带一个置信度。整个响应 70 到 500 毫秒,比你眨眼还快。
官方管这叫「System One 模型」,名字取自《思考,快与慢》:普通大模型是慢思考的系统 2,Jev 是那个凭直觉秒答的系统 1。「Jev」这个名字则来自经济学家 Jevons,就是提出「效率越高、用得越狠」那个悖论的老哥,起名品味确实有点东西。
快和便宜到什么程度
先说数字,再说水分。
官方口径:延迟 70~500 毫秒,比前沿大模型快最多 193.6 倍、便宜 444.6 倍。输入 token 收费 $0.042 / 百万,输出 token 免费,因为它不生成文本,输出便宜到「不值得装电表」(官方原话:too cheap to meter)。
快的原因很朴素:大模型写 100 个字要跑 100 次计算,Jev 对所有问题只跑一次计算、并行出答案。它不是「输出受限的大模型」,而是另一种架构,训练方法叫 RLCD(校准决策强化学习),创始人 Diogo Almeida 是前 OpenAI 研究员、RLHF 的共同发明人之一,相当于「教会 ChatGPT 说人话」的人之一,现在跑出来说:让模型说人话这条路线,搞自动化是走不通的。这人在 HN 评论区挨个回复质疑,ID 叫 CompleteSkeptic(完全怀疑论者),自嘲拉满。
水分在哪:193.6 倍 / 444.6 倍这些数字全是官方自报,参照系是 GPT-6 Astra 和 Claude Fable 5.1 开满推理的平均水平,测试用的工作流还是自家员工手搓的。官方自己承认这些「处于真实收益的高端区间」。姿态挺诚实,但截至我写这篇,还没有独立复现。
社区三天玩出了什么花样
发布三天,网友的整活速度比模型的延迟还快:
- 打 Doom:官方 demo,把游戏状态转成文字喂给 Jev,每秒问 10 次「往哪走、开不开枪」,成本约 7 美元一小时。评论区一半人在喊「游戏 QA 要失业了」,另一半在喊「你们重新发明了外挂」。
- 打宝可梦赢了 Opus 5:X 上有人实测,Jev 打宝可梦对战赢了 Claude Opus 5,成本约 1/820,速度快 10 倍。据说它的第二、第三候选也是合理战术。
- 帮浏览器 agent 提速:Browser Use 团队两天内出了官方集成,浏览器 agent 的每一步「点什么、点哪个」改成问 Jev,一次网络往返出两个决策,在 Google Flights 上搜完苏黎世到伦敦的机票全程 7.1 秒。
- 给 Claude Code 当剪刀手:一个叫 fast-jev-compaction 的插件,一天收了 1500+ 星。思路很鸡贼:对话太长要压缩时,不让大模型写有损的摘要小作文,而是逐个问 Jev「这段工具调用还留着吗」,保留的全是原文,一个字不丢。
泼冷水时间:它打牌是个鱼
光看 demo 容易上头,说个做得非常扎实的翻车实测。
有人拿德州扑克求解器当标准答案,测了 Jev 在 150 个决策点的表现:和最优解的吻合率只有 63%。最精彩的是这个:手里握着天顺(怎么打都不会输的牌)时,16 次测试它 16 次全下,正确动作明明是过牌。一个「能过牌就过牌」的一行规则都能打赢它。
更扎心的是置信度倒挂:它错得最离谱的地方给出最高置信度(0.86),最接近正确的地方反而只有 0.09。而且要它判断输赢,得先把「你是 A 花,对方没出路了」这种结论嚼碎了喂给它,它自己从原始牌面推不出来。

官方自己也很诚实地发了个「翻车清单」,承认的短板包括:不会数数、不会算日期先后、state 太长太杂准确率就掉、会被材料里的对抗内容带偏。另外它训练以英语为主,中日韩文本「能用但准确率更低」,对中文场景是实打实的限制,具体低多少,官方没说。
「零幻觉」是个文字游戏,但不是纯吹
官方宣传「零幻觉」,数学上还真的成立:它的输出被焊死在你给的选项集合上,不可能凭空编一个选项、编一个字段、编一段 JSON。大模型那种「编得有鼻子有眼」的幻觉,在它这里物理上不存在。
但它会在选项之内,高置信度地选错。错误形式从「编瞎话」变成了「自信地做错决定」,后者其实更隐蔽,因为输出格式永远合法,程序不会报错,错得悄无声息。扑克实测里那 0.86 的自信 all-in 就是证据。
跟我们有啥关系
如果你不是开发者,这东西短期不会出现在你的对话框里,但它很可能出现在你用的 App 里。它最适合的活是给大模型当门卫:意图分类、内容审核、把简单请求路由给便宜模型、难的升级给贵的。HN 上的共识是,这类「判断题」能替掉现有 AI 流水线里 40% 到 70% 的大模型调用。翻译成人话:以后 App 里那些「AI 一键分类」「AI 智能筛选」会更快、更便宜,便宜到以前舍不得做的功能现在值得一做。
如果你是开发者,社区给的上岗前军规就一条:拿你自己业务的几十个带标准答案的样本先考它一遍,置信度阈值在你自己的数据上调好,低置信度的交给人工。demo 里的它和你业务里的它,可能不是同一个它。
写在最后
Jev 让我感兴趣的不是它多聪明,它明显不聪明,扑克都打不明白。而是它把「往程序里注入一次 100 毫秒、一厘钱的智能判断」变成了一个 API 调用。以前很多功能不是做不出来,是「为这点小事调一次大模型」在经济上荒谬,现在不荒谬了。
当然,它是 v1:闭源、只吃文本、中文打折、性能数据自报、护城河存疑(有人已经用 1.5B 的开源模型整出了 2~3 倍的加速方案)。现在正确的姿势是拿边缘场景试水,别把核心链路押上去。
毕竟,一个只会做选择题的面试官,让他筛简历挺好,让他决定录用谁,你还是自己来吧。