为什么DeepSeek就是不听话?设计如此...
关注公众号回复1
获取一线、总监、高管《管理秘籍》
据Vectara HHEM人工智能幻觉测试,DeepSeek-R1显示出14.3%的幻觉率,是V3的近3倍:
幻觉通常源于模型训练数据中的噪声、过拟合、或生成策略的不可控性:
数据偏差:训练数据包含错误或矛盾信息; 模型过拟合:对训练数据中的噪声过于敏感; 生成策略自由度过高:解码时缺乏事实一致性约束;
换句话说:R1的设计就是如此。
V3模型更适合工程API调用,其追求的是安全稳定;而R1其目的就是复杂推理优先,他放宽对生成内容的约束,允许更高自由度的逻辑跳跃和创造性生成。
接下来,我们从工程视角对R1幻觉率高进行进一步拆解。
天生残疾
熟悉的同学知道,我在AI+医疗领域一直有很高的参与度,而R1在医疗侧的表现是很一般的。
我们在处理某三甲医院AI问诊系统时,发现DeepSeek-R1存在严重的药物禁忌混淆问题,溯源发现其训练语料可能存在结构性缺陷:
伪科学养生,他偶尔会将“生姜抗癌”作为医学结论输出,这是可能是很严重的事故; 专业术语歧义,他会混淆“病理分级”与“临床分期”,而这种混淆对我们进行医学判断是“致命”的; 政策解读偏差,误读医保报销比例调整文件,这里其实有点为难DeepSeek,因为国内每个省的医保药物策略可能都不相同;
综上,对于严肃AI应用场景,包括医疗、法律、教育等,对于结论的输出必须能够溯源,最好遵循权威指南。
创新 VS 准确
在进行知识问答过程中,我对生成参数进行了很简单的测试:
# 参数调节实验(法律咨询场景)
for temperature in [0.3, 0.7, 1.0]:
response = model.generate(
prompt=legal_query,
temperature=temperature,
max_length=500
)
evaluate_factual_accuracy(response)
结果符合预期:
温度=0.3时:事实准确率较高,但语言机械如法规汇编; 温度=0.8(默认)时:流畅度提升,但虚构条款概率达10%+; 温度=1.0时:生成内容堪比资深律师口吻,但关键数据错误率飙升;
当前架构下,生成质量与事实性可能呈负相关。R1温度值较高,本质是向用户体验妥协的技术决策。
知识更新
按理说,大模型知识更新慢个半年一年的似乎没什么相关,但是这在医疗场景下又是致命的!
比如,当前又流行了什么流感,模型中其实是没有相关的信息的,模型其实该选择不作答,但他们真实的反馈是强行回答,并且极其自信!
在金融体系中有类似的问题:
输入:2024年3月发布的《私募基金监督管理条例》主要修订内容 输出:新规强调合格投资者需满足...(实际该条款已于2023年12月废止)
这个其实做一点小优化就好,问题不大:
A[用户问题] --> B{是否需要时效性数据}
B -->|是| C[调用必应搜索API]
B -->|否| D[调用基础模型]
C --> E[证据提取与校验]
E --> F[约束性生成]
总之,在垂直领域,R1有点像东郭先生...
应对严肃场景
尽管R1存在高幻觉率的问题,但通过工程化手段仍可在特定场景中发挥其优势。以下是几种可行的实践方案:
RAG(检索增强生成)
在生成答案前,先从权威知识库中检索相关信息,确保输出基于事实。
在医疗咨询中,RAG可从医学指南中提取相关建议,避免模型虚构内容。
显著降低幻觉率,提升答案的可信度。
规则引擎兜底
对关键输出(如法律条文、医疗建议)进行规则校验,确保其符合预设标准。
在法律咨询中,规则引擎可校验生成条款是否与现行法律一致。
防止模型生成明显错误的内容。
结语
DeepSeek-R1的高幻觉率本质是技术路径的主动选择:通过放宽生成约束以换取复杂推理能力的提升。
这种设计在激发创造性的同时,也放大了错误累积风险:长思维链的生成虽能模拟人类推理过程,却可能因单步错误引发“蝴蝶效应”,尤其在医疗、法律等容错率极低的领域,这一问题被进一步放大。
当前,模型在生成自由度与事实准确性间的平衡仍显粗放。工程实践中,需以RAG、规则引擎等技术手段为“安全绳”,通过检索增强与逻辑校验实现“有边界创新”。
未来,若能在训练中嵌入中间步骤的监督信号,或引入实时验证模块,或许能在不牺牲创造力的前提下,为模型构建更稳固的事实性护城河。