Jev 的「不会幻觉」,官方自己在脚注里打了折
写这种代码的人应该不少:让模型判断一段文本属于哪一类,它回一段 JSON,你拿字符串去匹配。它偶尔加一句解释、换个字段名、或者干脆输出「是的,因为……」,解析就崩了,后面的流程全得重来。
这两年有个做法是把「生成」这一步拿掉:不让模型写字,直接读它在几个候选答案上的概率。TypeSafe AI 的 Jev 是这条路上目前最响的一个,9 月 15 日发布,自称第一个 System One 模型。
结论先放这儿:Jev 说的「不会幻觉」指的是它不会输出非法格式,不是不会判断错;而这个折扣,是官方自己在脚注里打的。
● ● ●
它不生成文字,只给选项和概率
Jev 不是 LLM,它不吐任何 token。你给它一段 state 和一组问题,它一次前向把全部答案连同概率一起交回来。
两种拿答案的方式
一次请求里的所有问题是并行回答的,官方写的是「一个问题的答案不会成为另一个问题的上下文」。定价是输入 $0.042 / 百万 token、输出免费,单请求 64k 上下文,其中 state 加最长那条问题不超过 32k。
不生成 token 的直接好处就一句话:调用方拿到的是「一个选项 id 加一个概率」,不存在格式解析失败。那句传遍技术圈的「can't hallucinate」,就是从这儿来的。
● ● ●
官方自己在脚注里,把它改成了一句更小的话
发布博文里那句话是完整的:「While Jev gives up string generation, it's optimized for structured outputs and can't hallucinate.」
配图上是 0% 的幻觉率,脚注里写着这 0% 是怎么来的:「Our number is not empirical. Schema matching is guaranteed, thus we can confidently add 0% into the plots.」,不是实测出来的,因为格式匹配是数学上保证的,所以可以放心地把 0% 加进图里。
同一天上线的文档,口径和脚注一致。校准页写的是「在成组预测上测的校准,不保证某一个答案是正确」;FAQ 里写的是「Jev 保证的是它答案的形状,不是每个决定都对」。
把这些句子放在一起,意思很清楚:格式错的概率被结构消掉了,判断错的概率一点没消,只是它不再叫幻觉。
三级收窄
● ● ●
官方自己列了 9 条「它会怎么错」
发布两天后,官方上线了 jaggedness 页,逐条列出 Jev 1.13 的失败模式。写这篇文章时最该带走的四条是:
最后一条最值得记住:它会给你概率,但同一批概率之间不一定自洽。Noul 给出的 0.22 和 Choice 里 yes 的 0.01,官方自己说这两个数不可换算。
这份清单本身就是一份「不许问它什么」的说明书。它比任何第三方评测都实用,因为是官方自己写的,也没法被说成外人不懂。
● ● ●
创始人自己在评论区认了
HN 上那篇发布帖拿到了 1890 分。有位评论者说「这基本上就是个 zero-shot 分类器」,创始人 Diogo Almeida 回了两个字:「exactly right!」。同一帖里他还有一句让步:「因为这些模型是概率性的,它也可能非常自信地错。」
另一个高赞评论只有一句话:「Type safety is not factual correctness.」类型安全不是事实正确。这句话大概是对这场发布最省字的总结。
● ● ●
快 193.6 倍是真的,只是没说比谁快
首页上那两个数是快 193.6 倍、便宜 444.6 倍。同一篇里官方自己标了「我们预期这些是真实收益里偏高的一档」;评测跑在自家西海岸的笔记本上;题目是自家四个 workflow;参考答案是 GPT-6 Astra 与 Claude Fable 5.1 高思考档逐题作答的平均值,官方也承认这偏向这两家的模型。
官方明说不发公开基准:「We deliberately chose not to publish performance against public benchmarks.」
真正调过它 API 的第三方有几份,数字差得很开,这也是我一行行去核的原因:
NearHere 那组最有参考价值:把基线换成便宜的小模型,193.6 倍就变成大约 5 倍快、8.6 倍便宜。引倍数必须带上对手是谁,换了对手就换个数。
倍数的口径
顺手记一条方法论:热度最高的帖子不是最好的证据。主帖 1890 分,而真跑过 API 的实测帖,一个 1 分、一个 2 分。看一个新模型的发布,值得专门去把低分的实测帖捞出来。
● ● ●
回到开头那段解析代码
把「写一段话再解析」换成「在选项里读概率」,消掉的是一整类失败:格式解析、字段漂移、多余解释。Jev 把它做成了产品,这条路值得跟。
它没有把幻觉消掉,只是把它挪了个地方。答案永远落在选项集合里,概率永远在 0 和 1 之间,这两条都不是「判断对了」。判断错的时候,它还会给出一个看起来很确定的数字;而需要数数、需要算术、state 里塞了无关细节、或者输入里混进了别人写的话时,那个数字尤其不能当证据。
所以真要引入这类东西,模型调用那一行好换,验收方式难换:不再盯着 JSON 能不能解析,而是拿你自己那批有标准答案的样本去对答案,并且专门测三格:state 拉长之后准确率掉多少、输入里混进对抗性文字之后答案动不动、同一批问题的多个概率之间是否自洽。
类型安全消掉的是格式错误,判断错误还得靠你自己的样本集去发现。
你打算把它用在哪一格:审核分类这种单问单答、多问题批量打分、还是嵌进 agent 当一个门控?评论区说一声,我按票数把那格拆开测。
● ● ●
参考来源
- 01
TypeSafe AI 发布博文《Introducing System One Models and Jev》:https://typesafe.ai/blog/introducing-system-one-models-and-jev - 02
官方文档(模型规格 / 三原语 / 校准 / jaggedness 页):https://docs.typesafe.ai/ - 03
官方评测站:https://evals.typesafe.ai - 04
Hacker News 讨论帖:https://news.ycombinator.com/item?id=49717558 - 05
Emil Lindfors 的挪威语实测:https://lindfors.no/blog/a-first-look-at-typesafes-jev/ - 06
NearHere(Jon Reed)的事件审核实测:https://nearhere.events/blog/typesafe-jev-mistral-gemini-event-validation - 07
Cribl 的日志分类实测:https://cribl.io/blog/what-typesafes-jev-means-for-telemetry/