findyi

Jev全网爆火...

大家好,我是洋哥。

最近被讨论的Jev,有个挺反常识的地方:它不陪你聊天,也不负责写文章。别的模型不断展示自己能做多少事,它却把重点放在一类更窄的任务上。比起争论它会不会取代大模型,我更想聊聊:这件事,会怎样改变我们用AI的方式。

9月15日,TypeSafe AI发布Jev,将它定位为“System One Model”,也就是系统一模型。你先给它材料、问题和明确的答案范围,它返回选择、评分或概率,供软件继续处理,而不是给你写一大段解释。

这个词听起来有点技术。但往工作里一放,你就明白了。

客户发来一句话,是咨询价格,还是反馈故障?收到一条用户意见,应该先交给产品,还是客服?整理一批资料,哪些值得继续读,哪些可以先放下?

这些事不一定需要一篇长答案,却会在工作里反复发生。

Jev让我更关注的,不是AI又多了一个名字,而是一个方向:我们需要的,未必是一个包办所有事情的AI,而是一套分工清楚的做事方式。

你需要的,未必是更长的答案。

举个假设的客服场景。

客户说:“已经付钱三天了,怎么还没发货?”

这时,系统先要识别对方在催发货,再查订单。等订单状态核实了,才轮到起草回复。如果涉及补偿,还得检查规则、确认权限,必要时转人工。

识别意图、查询数据、组织语言、决定补偿,是四件不同的事。你不能因为AI很会安抚客户,就默认它知道真实的物流状态,更不能顺手把退款权限也交出去。

Jev主要瞄准的是其中那些答案范围明确的小判断。按照官方文档,它可以从给定选项里选择、按标准评分,或者返回某个判断成立的概率。这不是替你完成整项业务,而是给流程中的一个环节提供结果。

当然,分类、打分并不是Jev才发明的,通用大模型也能做,传统程序也能完成不少任务。它值得观察的地方,是把这类判断作为专门的产品来优化。

至于放进你的工作后,究竟能快多少、便宜多少、错多少,要拿真实任务测。宣传中的倍数,不能直接变成自己的业务收益。

真正用起来的人,先把边界划清。

破局的孟健,9月20日分享了他把Jev接入ShipSite的过程。

我觉得值得大家看的,不是又接上了一个新模型,而是他没有让新模型接管一切。

按他的复盘,原来的主生成模型没有换,Jev只承担两个辅助任务:给模糊的修改需求提供意图标签,给候选搜索词做分类。规则能够处理的,仍然先用规则;判断标签也不能直接变成执行指令。

更重要的是,这条试验链路只对指定内部账号和测试工作区开放,付款、删除、生产审批等敏感流程不交给它。低置信度或超时,就退回原有逻辑。

他还明确写了一个容易被忽略的事实:截至发帖时,虽然完成了测试验收,但自然业务工作流里还没有观察到真实命中。

也就是说,这是一份有边界的接入试验,不是“已经替公司省下多少钱”的成功故事。

我反而觉得,这样的分享更有价值。测试跑通了,就说测试跑通;业务收益还没发生,就继续观察。做AI项目,不能把演示、测试和实际经营混成一件事。

如果你也想把AI用进工作,却不知道从哪一项任务开始,可以先来破局3天体验卡,了解普通人AI转型的基本思路。

7天破局星球会员+3天9小时直播,专业导师带你拆解普通人AI转型的底层逻辑,扫码就可以开始学习。

Image

不会乱说,不代表不会选错。

围绕Jev,有一种说法很容易让人兴奋:不生成文字,是不是就没有幻觉了?

这里要分清两件事:答案格式对不对,和答案内容对不对。

考试只允许填A、B、C、D,确实不会写出一段跑题的小作文,但照样可能选错。一个模型把投诉分进了“普通咨询”,返回格式再工整,也没有把事情做好。

官方自己也列出了Jev 1.13的局限,包括数值计算、日期比较、多层推断和干扰信息等。它不是一个可以放心接管所有判断的系统。

所以,搭AI工作流不能只问“这一步能不能自动化”,还要问“如果判断错了,会发生什么”。

资料分错一类,可以人工改回来;付款、删数据、对客户作出承诺,代价就不一样。这些地方,权限规则和人的确认不能因为模型返回了一个很高的分数就被跳过。

我们需要的不是让AI表现得永远有把握,而是让整个流程在它没把握、甚至判断错的时候,仍然有办法停下来、退回去、找人处理。

普通人先别急着装,先拆一件事。

我现在有20多个AI员工,参与内容、战略管理和产品研发。团队里的AI员工,也开始有初步的业务协同。

但这不意味着大家都要照着配20多个,更不意味着又出来一个模型,就得马上加进自己的工具箱。

我一直讲AI系统化,落到这里,其实就是把工作拆清楚:哪些事情有固定规则,哪些需要理解语义,哪些需要生成内容,哪些必须由人负责。

比如你每周都要整理客户反馈,就先拿出一小批经过脱敏的历史记录,不碰未经授权的客户资料。把“产品故障、使用咨询、功能建议”等类别写清楚,再加一个“无法确定,转人工”。

先由你标一遍,再让AI试着分。不要只看对了多少条,还要看错在哪里:是类别本身重叠,还是材料不够,或者它把一句客气的抱怨当成了表扬?

把这些问题改清楚之后,再算一笔账:整理时间有没有减少,复核和返工有没有增加,工具费用值不值得。

如果目前的工具已经够用,就不必换。只有这一步确实成了成本或速度上的瓶颈,再考虑让技术同事评估Jev这类专门的判断模型。

你熟悉客户怎么表达、知道什么问题容易误判、清楚哪一步不能出错,这些经验并没有因为AI出现就失去价值。相反,它们可以变成分类标准、验收条件和处理例外的方法。

Jev最终会走多远,还需要更多真实使用来验证。我的判断是,AI应用接下来值得看的,不只是模型能力,还包括这些能力怎样被安排进具体的工作。

别再只问“哪个AI更厉害”。多问一句:“我手里这件事,到底该怎么分工?”

能把这个问题回答清楚,你就不只是在追新工具,而是在一点点建立自己的工作系统。

如果你想开始做这件事,也欢迎来破局3天体验卡。带着一项每天都在重复的工作来,先找到可以尝试的一步。

7天破局星球会员+3天9小时直播,专业导师带你拆解普通人AI转型的底层逻辑,扫码就可以开始学习。

Image