我艹,好险,差点被DeepSeek幻觉害死!
手里有些AI岗位;想找工作的同学可联系,急缺高级产品经理
关注公众号,回复1,与我交个朋友吧
我尼玛,这次差点被DeepSeek坑死!
原因是前些日子疑似华为离职员工自曝盘古事件,我想到网上找一些类似事件,同时使用的GPT和DeepSeek,结果看着DeepSeek的更吸引人就采用了两条。
关键提示词是:国外还有类似这种技术人员爆料事件吗?从结果来看:时间地点人物事件,一应俱全!
这些信息可大可小,结果全部是胡编乱造的,我尼玛,服气,真的不知道文章发出去火了会有什么后果,我去他妈的,真的不能相信AI...
前几个月《高层论坛:实现汽车产业高质量发展》才刚召开,因为汽车行业卷得不行,现在大家都想在智能驾驶上发力,其中有句话令我影响深刻:
对智能驾驶来说,安全是最大的奢侈
而这一回旋镖马上就击中了小米,从现在来看疑是是由于智能驾驶导致的车祸而导致重大车祸:
怎么说呢?对于AI产品来说:安全是1,有效是0,不安全什么都没有!
对于智能驾驶,不出事是1,跑得快是0
智能驾驶是,模型开发也是如此,比如基于模型做出来的产品更是如此!
无独有偶,国外其实也有一产品Character.AI涉及过“AI杀人案例”:
2024年2月28日,美国佛罗里达州的14岁男孩塞维尔·塞泽三世(Sewell Setzer Ⅲ)在与Character AI上的AI角色进行长时间聊天后开枪自杀身亡。
后来,她的母亲对Character AI提起诉讼,认为Character AI以“拟人化、过度性化和令人恐惧的逼真体验”导致她儿子对AI角色上瘾,并深陷其中。
模型是通过海量语料进行训练的,基于模型的AI产品背后拥有成百上千的SOP。
无论是对模型投喂的数据,还是用于“取悦”用户的SOP,背后会涉及大量行为学、心理学等知识,意思是:如果我们想,用户与AI聊天甚至可以达到游戏的体验!
事实上,模型本身就具备这种能力,比如大模型的“谄媚”特性就尤其突出!
所谓“谄媚”,就是模型很容易被引导,从而给到赞同、符合你心理预期的回答,而这对于心智缺乏的用户可能导致巨大问题!
举个例子:用户曾经可能只是比较消极,而且他懵懵懂懂,但由于更大模型的对话过程中,消极的情绪会被进一步扩大,并且大模型会有理有据证明用户的消极,这种高端思维来源于先哲的思辨,对心智缺失的用户会造成降维打击,从而引发巨大的心理冲击,而过程中一个引导不利就可能导致错误行为...
所以,现在很多政策正在要求互联网产品主动披露其在产品设计方面的“暗黑模式”,或立法对“暗黑模式”进行限制。
抛开应用层的包装与引导,这里我们回归模型本身,模型本身其实也挺不安全的...
据Vectara HHEM人工智能幻觉测试,DeepSeek-R1显示出14.3%的幻觉率,是V3的近3倍:
模型幻觉
模型是各AI产品的底座,但是他好像天生残疾,是个阴阳人,没有什么坚定立场,很容易被影响不说还非常自信,并且总是一本正经的胡说八道...
还是之前的经典案例,我在使用最先进的模型GPT的Deep Research,让他解决的问题是:梳理所有的医疗信息发布渠道,并且按权威性排序。
首先,这个问题本身的复杂度是极高的,我并不期待模型能够给出完整的回答,但是他给我的回答是:
这里马上出了巨大问题,我虽然不期待模型给我完善的回答,但是他不能有关键的错漏,比如:连最基础的医疗教科书都没有,这我是不能忍的...
而其他模型在这种复杂问题上,表现也是不佳的。
稍微上升下问题:如果模型在治病的时候发生了漏诊、如果模型在给予治疗方案的时候采用了过期的方案,给到了错误的药物,那怎么办?
而实验显示,在医疗问答任务中,模型对错误答案的置信度(softmax概率)常高于正确答案。
这种错误自信现象源于训练数据中伪科学内容的高频出现,如“维生素C抗癌”在健康论坛中的重复强化。
而从模型实现原理来说,这就是他的原罪,并且靠模型自身是难以自己解决的。
幻觉根由
模型幻觉的定义已经比较清楚:模型自信地生成不真实答案的情况。
关于幻觉的原因近期OpenAI罕见的发表了论文,系统性地揭示了幻觉的根源:Why Language Models Hallucinate
这篇论文将幻觉从玄学拉回了统计学:只要现代训练,评测管线鼓励在不确定时“猜”,而不是“承认不确定/放弃作答”,模型就会系统性地产生看似合理却错误的输出。
模型是根据训练数据中的概率分布来预测输出,因此它并不具备真正的理解力,而是生成在语义上高度符合统计规律的文本,从这个逻辑来说,模型应该归属于统计学领域。
以下是更为专业的回答:只要在“这个输出是否有效”的二分类上存在不可避免的误差,下游生成就不可能零错误。这把“幻觉”还原为统计学习里最熟悉的对象,二分类误差。
而后训练(RLHF/DPO 等)常以“通过基准考试”为目标,而大多数主流评测都采用 0/1 计分:答对得 1 分,答错或“不作答/不知道(IDK)”得 0 分。
这个激励结构会系统性惩罚不确定性表达,从而推动模型在不确定时“猜”。这就是论文所谓的“评测惩罚不确定的流行病”。
综上,可以看出模型依旧是由奖惩驱动,这点倒是与人性别无二致,这就像一场设计有缺陷的考试,逼着考生(模型)去猜答案,而不是承认自己不会。
接下来我们根据论文信息简单打开细节:
预训练阶段:内在缺陷
模型通过海量文本进行自监督学习,其核心任务是预测下一个词(token)。这个过程在本质上是一个概率抽样游戏,其中已埋下了幻觉的种子:
统计必然性
只要模型是一个会出错的概率分类器,其生成过程就必然伴随着错误的累积。
每一个词的预测都存在一定的错误率,在生成长文本时,这些错误会逐词累积、放大和传播,最终导致整体输出偏离事实。
论文通过数学推导证明,这是一个无法完全消除的固有属性。
数据稀缺性
训练语料中存在着大量的“单例”,即那些只出现一次的事实或概念,对于这些信息,模型缺乏足够的上下文进行学习和巩固,记忆极其脆弱。
当后续被问及相关问题时,模型基于薄弱的统计信号进行生成,极易产生错误。
研究表明,模型在“单例”事实上的错误率显著高于高频出现的事实。
模型表达能力的局限
即便数据充足,模型也可能因其架构和参数规模的限制,无法完全捕捉和记忆数据中所有复杂的关联和事实。
这种“学不到”或“学不全”的能力上限,直接导致了在面对某些复杂或隐含逻辑的问题时,模型只能依靠“猜测”来填补认知空白。
评估阶段:扭曲的奖励机制
论文最具颠覆性的论点在于,它指出当前的评估体系是幻觉问题的“放大器”。
主流的评估基准(如MMLU, GPQA, MMLU-Pro)普遍采用二元评分规则(Binary Scoring):答案非对即错,答对得1分,答错或回答“我不知道”(IDK)都得0分。这创造了一个扭曲的激励结构:
对于模型而言,选择“蒙一个答案”的期望收益是 (概率答对 * 1) + (概率答错 * 0) = 概率答对;
而选择“我不知道”的期望收益恒为0;因此,只要模型认为自己答对的概率大于0,那么“蒙答案”在数学上就是更优的策略。
这无异于鼓励模型隐藏其不确定性,用虚构来博取得分机会,而且模型的规则也是惩罚老实人的!
在上述规则下,坦诚地表达“我不知道”是一种严格劣势策略。
这不仅压制了模型诚实的天性,更使得它在追求更高排行榜分数的驱动下,变得越来越“油滑”和“敢于编造”。评估没有奖励诚实和谨慎,反而奖励了“自信的谬误”。
了解幻觉的根由后,会帮助我们更好的与模型协作,比如:
关于幻觉的五大流行误解
事实上,OpenAI该论文有很大的正本清源的作用,因为关于幻觉市面上有很多误解:
一、提高准确性可以消除幻觉
准确性永远无法达到100%。世界是复杂且充满不确定性的,许多问题本身就没有明确答案,或存在争议。
追求100%准确是一个不切实际的目标,模型必须学会管理不确定性,而非消灭它。
二、幻觉是不可避免的
生成错误内容或许是不可避免的,但输出错误内容(即产生幻觉)是可以避免的。
关键区别在于,模型在不确定时完全可以选择不回答。因此,问题在于“输出控制”而非“完全消除错误认知”。
PS:这块的描述其实相当于还是在说无可避免
三、避免幻觉需要极高的智能
避免幻觉更关乎“自知之明”而非“全知全能”。
一个对毛利语一无所知的小模型,会老实回答“我不知道”;而一个知识丰富但并非万能的大模型,可能会因为“自信”地编造毛利语语法而产生幻觉。
智能规模与幻觉频率并非简单的负相关。
四、幻觉是玄学
幻觉并不神秘。
其产生机制(概率抽样错误)和其在评估中获得奖励的原因(二元评分规则)在统计学上清晰可辨,可以被充分理解和分析。
五、好的幻觉评估方法能解决问题
在当今AI社区中,存在着数百个以“准确性”为尊的传统评估基准。
一两个专门针对幻觉设计的新评估标准(如Confidence-Aware QA),其影响力难以撼动整个追求“高准确率”的评估文化。
治本之策在于改革所有主流的评估体系。
最后是论文提供的一些解决方案:
解决方案
OpenAI认为,无需推倒重来所有模型和基准,而应通过修改评估的“游戏规则”,从根本上改变模型的行为模式。核心方案是引入基于置信度的评分规则:
一、引入置信度
在给模型的指令(Prompt)中明确要求,仅当其答案的置信度高于某个阈值(如t=0.75)时,才作出回答;否则,应输出“我不知道”。
同步改革评分体系,使其与新的指令相匹配。论文提议采用一种扣分制(Penalty System):
答对:得 +1 分; 回答“我不知道”:得 0 分(不奖不罚); 答错:得 -3 分(或一个显著大于1的负分);
二、机制何以生效?
这一改革的核心在于改变了模型决策的数学期望(Expected Utility):
“蒙答案”的期望收益 = (Prob_correct * 1) + (Prob_wrong * -3); “回答IDK”的期望收益 = 0;
当模型对自己的答案不确定时(例如,Prob_correct = 0.6):
蒙答案的期望收益 = (0.6 * 1) + (0.4 * -3) = 0.6 - 1.2 = -0.6;回答IDK的期望收益 = 0;显然,0 > -0.6,此时选择“我不知道”成为了数学上的最优策略。
通过这种方式,评估体系成功地将模型的优化目标从“不惜一切代价追求正确” aligning(对齐)到了“在不确定时保持诚实”。
模型被激励去更好地校准(Calibrate)自身的置信度,因为过度自信(高置信度但错误)将带来严厉的惩罚。
有利有弊
幻觉虽然带来了一些问题,但上述消灭幻觉的策略,我认为可能是无法进行的,因为最直接的风险是模型从“乐于助人的助手”转变为“过度谨慎的官僚”。
模型可能会过于频繁地回应“我不知道”,即使它实际上拥有足够的信息可以提供一个大概率正确的、有用的答案。这会显著降低模型的实用性和效率。
比如用户问“珠穆朗玛峰有多高?”,模型内部置信度为0.74(略低于阈值0.75),于是回答“我不知道”。
尽管这个信息在训练数据中极为常见,模型也“知道”答案,但出于对惩罚的恐惧,它选择了弃权,这会让用户感到失望和困惑。
很多情况下,一个带有概率信息的近似答案(“大约8800米,但不同测量方式可能有差异”)远比一个简单的“我不知道”更有价值。
大模型功能性退宿是上述策略最大的问题,并且人类其实是渴望马上得到答案的,如果你要做谨慎的专家,那么我一定会选择另一个马屁精模型
上述还只是策略无非十全十美,设计层面的问题,真有实施还有执行上的成本:
置信度?
论文方案的核心前提是模型能够准确量化并输出其“置信度”。
然而,置信度校准本身就是一个巨大的技术难题,模型内部的概率输出往往不能真实反映其正确性的概率(即“过度自信”或“自信不足”是常态)。
校准不佳的模型在新规则下会表现极差:过度自信的模型依然会频繁幻觉并遭受重罚;自信不足的模型则会彻底“沉默”。
我们只是把“如何减少幻觉”的问题,转移成了“如何完美校准模型置信度”这个同样困难的问题。
只不过真正做过数据工程的同学才知道那有多难,那些所谓专业的人就一定正确?
除此之外,还有模型创意问题,模型对模糊性和复杂性的处理能力本来就是为人称道的部分,如果消除幻觉,那么就完犊子了...
结语
幻觉并非玄学,而是“统计误差”与“激励错配”共同作用的必然产物;安全性也不是可选项,而是系统不可动摇的根本底线。
只要评估机制仍在不确定情境中“鼓励猜测”,大模型就注定学会一本正经地虚构答案;只要产品设计仍将“流畅性”置于“可验证性与可问责性”之上,就等于将风险转嫁给用户与社会。
事实上,我这里倒是认为模型不必过于费心的去解决幻觉问题,所谓的置信度与可溯源是各个AI产品需要重点考虑的,让基座模型去解决五花八门的应用场景,本来就不科学。
好了,希望此文对大家有帮助...
点击上方卡片关注叶小钗公众号,查看下方二维码,添加我个人微信: