叶小钗

为什么DeepSeek就是不听话?设计如此...

关注公众号回复1

获取一线、总监、高管《管理秘籍》

据Vectara HHEM人工智能幻觉测试,DeepSeek-R1显示出14.3%的幻觉率,是V3的近3倍:

Image

幻觉通常源于模型训练数据中的噪声、过拟合、或生成策略的不可控性:

  1. 数据偏差:训练数据包含错误或矛盾信息;
  2. 模型过拟合:对训练数据中的噪声过于敏感;
  3. 生成策略自由度过高:解码时缺乏事实一致性约束;

换句话说:R1的设计就是如此。

Image

V3模型更适合工程API调用,其追求的是安全稳定;而R1其目的就是复杂推理优先,他放宽对生成内容的约束,允许更高自由度的逻辑跳跃和创造性生成。

接下来,我们从工程视角对R1幻觉率高进行进一步拆解。

天生残疾

熟悉的同学知道,我在AI+医疗领域一直有很高的参与度,而R1在医疗侧的表现是很一般的。

我们在处理某三甲医院AI问诊系统时,发现DeepSeek-R1存在严重的药物禁忌混淆问题,溯源发现其训练语料可能存在结构性缺陷:

  1. 伪科学养生,他偶尔会将“生姜抗癌”作为医学结论输出,这是可能是很严重的事故;
  2. 专业术语歧义,他会混淆“病理分级”与“临床分期”,而这种混淆对我们进行医学判断是“致命”的;
  3. 政策解读偏差,误读医保报销比例调整文件,这里其实有点为难DeepSeek,因为国内每个省的医保药物策略可能都不相同;

综上,对于严肃AI应用场景,包括医疗、法律、教育等,对于结论的输出必须能够溯源,最好遵循权威指南。

创新 VS 准确

在进行知识问答过程中,我对生成参数进行了很简单的测试:

# 参数调节实验(法律咨询场景)
for temperature in [0.3, 0.7, 1.0]:
    response = model.generate(
        prompt=legal_query,
        temperature=temperature,
        max_length=500
    )
    evaluate_factual_accuracy(response)

结果符合预期:

  1. 温度=0.3时:事实准确率较高,但语言机械如法规汇编;
  2. 温度=0.8(默认)时:流畅度提升,但虚构条款概率达10%+;
  3. 温度=1.0时:生成内容堪比资深律师口吻,但关键数据错误率飙升;

当前架构下,生成质量与事实性可能呈负相关。R1温度值较高,本质是向用户体验妥协的技术决策。

知识更新

按理说,大模型知识更新慢个半年一年的似乎没什么相关,但是这在医疗场景下又是致命的!

比如,当前又流行了什么流感,模型中其实是没有相关的信息的,模型其实该选择不作答,但他们真实的反馈是强行回答,并且极其自信!

在金融体系中有类似的问题:

  • 输入:2024年3月发布的《私募基金监督管理条例》主要修订内容
  • 输出:新规强调合格投资者需满足...(实际该条款已于2023年12月废止)
    这个其实做一点小优化就好,问题不大:
    A[用户问题] --> B{是否需要时效性数据}
    B -->|是| C[调用必应搜索API]
    B -->|否| D[调用基础模型]
    C --> E[证据提取与校验]
    E --> F[约束性生成]

总之,在垂直领域,R1有点像东郭先生...

应对严肃场景

尽管R1存在高幻觉率的问题,但通过工程化手段仍可在特定场景中发挥其优势。以下是几种可行的实践方案:

RAG(检索增强生成)

在生成答案前,先从权威知识库中检索相关信息,确保输出基于事实。

在医疗咨询中,RAG可从医学指南中提取相关建议,避免模型虚构内容。

显著降低幻觉率,提升答案的可信度。

规则引擎兜底

对关键输出(如法律条文、医疗建议)进行规则校验,确保其符合预设标准。

在法律咨询中,规则引擎可校验生成条款是否与现行法律一致。

防止模型生成明显错误的内容。

结语

DeepSeek-R1的高幻觉率本质是技术路径的主动选择:通过放宽生成约束以换取复杂推理能力的提升。

这种设计在激发创造性的同时,也放大了错误累积风险:长思维链的生成虽能模拟人类推理过程,却可能因单步错误引发“蝴蝶效应”,尤其在医疗、法律等容错率极低的领域,这一问题被进一步放大。

当前,模型在生成自由度与事实准确性间的平衡仍显粗放。工程实践中,需以RAG、规则引擎等技术手段为“安全绳”,通过检索增强与逻辑校验实现“有边界创新”。

未来,若能在训练中嵌入中间步骤的监督信号,或引入实时验证模块,或许能在不牺牲创造力的前提下,为模型构建更稳固的事实性护城河。

Image