alitrack

Jev 的「不会幻觉」,官方自己在脚注里打了折

写这种代码的人应该不少:让模型判断一段文本属于哪一类,它回一段 JSON,你拿字符串去匹配。它偶尔加一句解释、换个字段名、或者干脆输出「是的,因为……」,解析就崩了,后面的流程全得重来。

这两年有个做法是把「生成」这一步拿掉:不让模型写字,直接读它在几个候选答案上的概率。TypeSafe AI 的 Jev 是这条路上目前最响的一个,9 月 15 日发布,自称第一个 System One 模型。

结论先放这儿:Jev 说的「不会幻觉」指的是它不会输出非法格式,不是不会判断错;而这个折扣,是官方自己在脚注里打的。

● ● ●

它不生成文字,只给选项和概率

Jev 不是 LLM,它不吐任何 token。你给它一段 state 和一组问题,它一次前向把全部答案连同概率一起交回来。

两种拿答案的方式

两种拿答案的方式

原语
你要它做的事
返回什么
Choice
在最多 255 个选项里选一个
选中的项、每项概率、置信度
Score
给一个有序档位打分
分数、各级概率、档位说明
Noul
是或者否
P(是) 的数值

一次请求里的所有问题是并行回答的,官方写的是「一个问题的答案不会成为另一个问题的上下文」。定价是输入 $0.042 / 百万 token、输出免费,单请求 64k 上下文,其中 state 加最长那条问题不超过 32k。

不生成 token 的直接好处就一句话:调用方拿到的是「一个选项 id 加一个概率」,不存在格式解析失败。那句传遍技术圈的「can't hallucinate」,就是从这儿来的。

● ● ●

官方自己在脚注里,把它改成了一句更小的话

发布博文里那句话是完整的:「While Jev gives up string generation, it's optimized for structured outputs and can't hallucinate.」

配图上是 0% 的幻觉率,脚注里写着这 0% 是怎么来的:「Our number is not empirical. Schema matching is guaranteed, thus we can confidently add 0% into the plots.」,不是实测出来的,因为格式匹配是数学上保证的,所以可以放心地把 0% 加进图里。

同一天上线的文档,口径和脚注一致。校准页写的是「在成组预测上测的校准,不保证某一个答案是正确」;FAQ 里写的是「Jev 保证的是它答案的形状,不是每个决定都对」。

把这些句子放在一起,意思很清楚:格式错的概率被结构消掉了,判断错的概率一点没消,只是它不再叫幻觉。

三级收窄

三级收窄

● ● ●

官方自己列了 9 条「它会怎么错」

发布两天后,官方上线了 jaggedness 页,逐条列出 Jev 1.13 的失败模式。写这篇文章时最该带走的四条是:

失败模式
官方原话
数数
"Jev is not a calculator",它认得出答案的形状,不是真的在计数
长输入
"Jev suffers from context rot",state 里无关的细节越多,准确率越低
对抗性内容
"State is data, and jev-1.13 does not treat it as hostile by default",注入式的指令、自我论证式的文字能改变它的答案
结构不变量
同一张工单上,P(要退款)=0.72 与 P(不要退款)=0.47 同时出现,加起来 1.19

最后一条最值得记住:它会给你概率,但同一批概率之间不一定自洽。Noul 给出的 0.22 和 Choice 里 yes 的 0.01,官方自己说这两个数不可换算。

这份清单本身就是一份「不许问它什么」的说明书。它比任何第三方评测都实用,因为是官方自己写的,也没法被说成外人不懂。

● ● ●

创始人自己在评论区认了

HN 上那篇发布帖拿到了 1890 分。有位评论者说「这基本上就是个 zero-shot 分类器」,创始人 Diogo Almeida 回了两个字:「exactly right!」。同一帖里他还有一句让步:「因为这些模型是概率性的,它也可能非常自信地错。」

另一个高赞评论只有一句话:「Type safety is not factual correctness.」类型安全不是事实正确。这句话大概是对这场发布最省字的总结。

● ● ●

快 193.6 倍是真的,只是没说比谁快

首页上那两个数是快 193.6 倍、便宜 444.6 倍。同一篇里官方自己标了「我们预期这些是真实收益里偏高的一档」;评测跑在自家西海岸的笔记本上;题目是自家四个 workflow;参考答案是 GPT-6 Astra 与 Claude Fable 5.1 高思考档逐题作答的平均值,官方也承认这偏向这两家的模型。

官方明说不发公开基准:「We deliberately chose not to publish performance against public benchmarks.」

真正调过它 API 的第三方有几份,数字差得很开,这也是我一行行去核的原因:

谁的实测
任务
结果
NearHere
真实事件审核 50 例
准确率 96% vs Gemini 3.5 Flash-Lite 86% / Mistral Small 4 84%;平均 0.59 秒 vs 3.40 / 2.90 秒;每千次决策 $0.043 vs $2.496 / $0.370
Emil Lindfors
24 篇挪威语听证意见书
有序档位打分 19/24 vs DeepSeek V4.1 Flash 14/24;每千份文档 $0.22 vs $1.31 / $3.08;中位 0.32 秒 vs 2.7 / 26 秒
Cribl
28 类日志分类,负面样本
错得比专用分类器多 2 到 3 倍,最常见的失败是把已知类型塞进 "other" 桶
Every / Arize
垃圾邮件判定
98.3%,和 2003 年那套 TF-IDF 逻辑回归的 98.4% 打平

NearHere 那组最有参考价值:把基线换成便宜的小模型,193.6 倍就变成大约 5 倍快、8.6 倍便宜。引倍数必须带上对手是谁,换了对手就换个数。

倍数的口径

倍数的口径

顺手记一条方法论:热度最高的帖子不是最好的证据。主帖 1890 分,而真跑过 API 的实测帖,一个 1 分、一个 2 分。看一个新模型的发布,值得专门去把低分的实测帖捞出来。

● ● ●

回到开头那段解析代码

把「写一段话再解析」换成「在选项里读概率」,消掉的是一整类失败:格式解析、字段漂移、多余解释。Jev 把它做成了产品,这条路值得跟。

它没有把幻觉消掉,只是把它挪了个地方。答案永远落在选项集合里,概率永远在 0 和 1 之间,这两条都不是「判断对了」。判断错的时候,它还会给出一个看起来很确定的数字;而需要数数、需要算术、state 里塞了无关细节、或者输入里混进了别人写的话时,那个数字尤其不能当证据。

所以真要引入这类东西,模型调用那一行好换,验收方式难换:不再盯着 JSON 能不能解析,而是拿你自己那批有标准答案的样本去对答案,并且专门测三格:state 拉长之后准确率掉多少、输入里混进对抗性文字之后答案动不动、同一批问题的多个概率之间是否自洽。

类型安全消掉的是格式错误,判断错误还得靠你自己的样本集去发现。

你打算把它用在哪一格:审核分类这种单问单答、多问题批量打分、还是嵌进 agent 当一个门控?评论区说一声,我按票数把那格拆开测。

● ● ●

参考来源

  1. 01
    TypeSafe AI 发布博文《Introducing System One Models and Jev》:https://typesafe.ai/blog/introducing-system-one-models-and-jev
  2. 02
    官方文档(模型规格 / 三原语 / 校准 / jaggedness 页):https://docs.typesafe.ai/
  3. 03
    官方评测站:https://evals.typesafe.ai
  4. 04
    Hacker News 讨论帖:https://news.ycombinator.com/item?id=49717558
  5. 05
    Emil Lindfors 的挪威语实测:https://lindfors.no/blog/a-first-look-at-typesafes-jev/
  6. 06
    NearHere(Jon Reed)的事件审核实测:https://nearhere.events/blog/typesafe-jev-mistral-gemini-event-validation
  7. 07
    Cribl 的日志分类实测:https://cribl.io/blog/what-typesafes-jev-means-for-telemetry/