为什么DeepSeek的提示词与众不同?背后对AI应用有何影响?
关注公众号回复1
获取一线、总监、高管《管理秘籍》
前两天我们探讨了MLA、GRPO、MoE等创新对模型训练与推理成本的影响,今天我回归了节前写的一些文章,感觉对最开始的一些现象有了更多的解释,比如DeepSeek的提示词为什么与众不同?
GRPO与提示词的因果
节前,我们说过DeepSeek-R1是推理型模型,这对其提示词使用会有一些影响,比如:
团队汇报
❌ “请用PPT做个季度总结。” ✅ “我要准备季度总结,给老板和投资人看,希望展现我们在客户拓展上的增长趋势,突出市场优势,但担心数据不够有说服力,可能会被质疑增长质量。”
❌ “请写一篇竞品分析。” ✅ “我要写竞品分析报告,给销售和市场团队用,希望帮助他们理解对手的定价策略,但担心竞品近期未公开数据,信息可能不够完整。”
新的提示词公式变成了:
公式:我要 [目标],给 [受众] 用,希望 [核心诉求],但担心 [潜在挑战]
之所以提示词会有这种变化,这与R1的实现以及与GRPO是息息相关的。
GRPO之因
DeepSeek-R1-Zero的训练过程依赖于GRPO强化学习框架,这个框架的核心目标是通过对策略的优化,降低训练成本并提高模型推理的效率。
与传统的训练方式不同,DeepSeek-R1摒弃了微调环节,直接通过强化学习来增强推理能力,同时对模型的生成结果进行筛选和微调,从而确保输出内容更符合人类的期望和偏好。
在训练过程中,GRPO通过“组内相对策略优化”的方式,使得模型能够在不依赖明确标签数据的情况下进行推理策略的优化。
这种方式在解决推理问题时,注重过程中的反馈和自我优化,而不仅仅是最终的结果。以下是GRPO的核心技术细节:
准确性奖励:在数学问题或编程任务中,模型通过生成正确答案获得正向奖励,这激励模型向正确的方向推理。 格式奖励:鼓励模型在推理过程中明确展示思考步骤,比如将思考过程放在<think>标签内。这种格式化要求帮助模型更清晰地组织思路和展示推理路径。 自进化奖励:GRPO允许模型通过反思和自我调整,在推理过程中不断优化步骤和策略,从而提升在复杂任务中的表现。
基于GRPO的强化学习过程,模型的训练和优化着重于推理过程的改进,而不仅仅是最终答案的准确性。
这一点直接影响了如何构造和调整提示词的写法,这直接导致了我们提示词写法上的差异:
一、强化学习优化推理步骤
GRPO的强化学习过程注重的是推理的各个步骤,而不仅仅是答案本身。这种做法的影响在提示词的结构中表现得尤为明显。
通过加入“我要 [目标],给 [受众] 用,希望 [核心诉求],但担心 [潜在挑战]”这样的结构,模型能够明确识别出任务的具体目标、受众、核心需求以及潜在挑战,从而为推理过程提供更多的上下文信息。
这种结构帮助模型在推理过程中能够更清晰地组织思考路径,并逐步构建解决方案。
比如,任务是编写一个季度总结报告。
如果我们简单地说:“请用PPT做个季度总结”,这就无法给模型提供足够的信息来调整推理步骤和展现其思考过程。
通过改为“我要准备季度总结,给老板和投资人看,希望展现我们在客户拓展上的增长趋势,突出市场优势,但担心数据不够有说服力,可能会被质疑增长质量”。
这种结构化的提示词不仅告诉模型输出什么,还清楚地给出模型推理过程中需要克服的挑战。这就像在做一道数学题时,我们不仅关注答案是否正确,还要思考解决问题的最佳步骤。
二、 格式奖励和自进化能力
GRPO引入的“格式奖励”要求模型在生成推理过程时,将思考步骤明确展示出来,这直接促使了提示词的变化。
在模型的训练中,格式化的思考过程对于推理的准确性和清晰度至关重要。通过将思考过程放在<think>标签之间,模型能够更系统地整理推理步骤,这与在编写报告时明确思路、展示分析过程是相似的。
例如,当用户请求生成一份竞品分析报告时,传统的提示词可能简单地指令“请写一篇竞品分析”。
但如果转化为“我要写竞品分析报告,给销售和市场团队用,希望帮助他们理解对手的定价策略,但担心竞品近期未公开数据,信息可能不够完整”。
模型不仅获得了执行任务的目标,还明确了推理过程中的限制条件,从而有助于模型在推理时能够考虑潜在的不确定性和挑战。
三、自我优化与反思
GRPO的核心在于通过反思和自我优化来不断改进推理策略。
这一点在提示词中的体现是对潜在挑战的明确说明。在传统的提示词中,可能只是简单地指令模型完成任务,但GRPO让模型关注不仅仅是任务的完成,还要处理可能遇到的困难。
例如,在进行一项市场调研任务时,用户可能不仅关注如何写报告,还会有“担心数据不全”这样的潜在挑战。
这种表达方式促使模型在推理过程中进行自我审视和改进,就像做数学题时我们会反思哪些解题步骤存在问题,并在下一次作答时进行调整。
因果
总的来说,GRPO通过优化推理步骤和反馈机制,对模型训练产生了深远的影响。这不仅改变了模型如何生成答案的方式,也深刻影响了提示词的写作结构。
通过结构化的提示,模型不仅能够理解任务目标,还能根据潜在挑战调整推理路径,从而实现更高效和准确的输出。
如何进行GRPO?
这里,我们先简单拆解下GRPO的训练流程:
一、定义任务目标与奖励机制
首先,GRPO会为DeepSeek-R1定义一个明确的目标,并建立一套奖励机制。
在每次推理任务中,模型的目标是通过合理的推理步骤达成给定的任务目标。
奖励机制不仅仅奖励最终答案的正确性,还包括中间推理步骤的有效性。
这就意味着,模型在训练过程中,不仅关心是否得到了正确的答案,还会根据每个步骤的质量、有效性、以及推理路径的清晰度等因素进行奖励。
这里的主要奖励机制也就是之前说的准确性、格式、自进化奖励。
二、生成初步推理
在训练过程中,DeepSeek-R1首先会生成推理结果。
这是通过模型基于输入提示(如问题或任务)来产生答案或推理路径。
与传统模型不同,DeepSeek-R1不依赖于微调的静态数据集,而是通过在环境中进行探索(类似于玩游戏时的反复尝试)来生成结果。
对于每个任务,DeepSeek-R1会尝试不同的推理策略,通过生成多个潜在的推理路径,然后,GRPO会评估这些路径,给出基于目标的反馈。
例如,在回答一个数学问题时,模型不仅要给出正确的答案,还要清晰展示解题步骤。如果展示步骤的方式不清晰,模型将被扣除格式奖励。
三、强化学习与优化
通过强化学习框架,GRPO会对模型的每一步推理过程进行优化。
模型会在每个推理任务后,依据奖励机制调整自己的策略,通过策略优化过程不断自我改进:
探索与试错:模型会尝试不同的推理路径,并根据每次推理后的奖励反馈进行调整。相当于在任务完成后,模型会评估哪些步骤有效,哪些步骤需要改进。 迭代训练:随着训练的进展,模型会不断重复上述步骤,在每次尝试中通过“奖励”向正确的推理路径靠近,从而逐渐提高推理效率和准确性。
总结
在每一轮训练中,GRPO会通过策略优化算法(如PPO或A3C)更新模型的推理策略。
与传统的预训练或微调方式不同,GRPO不仅仅关注模型的最终输出结果,还会更新模型内部的推理策略和路径选择机制。
模型的策略是通过调整网络参数来实现的,这些参数控制模型如何选择推理路径、如何展示推理步骤以及如何反应反馈。
GRPO通过强化学习的迭代优化,不断调整这些策略,使得模型在不同任务中能够逐步改进推理步骤和策略。
随着训练的持续,模型会在GRPO的帮助下逐渐发现最优的推理路径。
在最初的阶段,模型可能会尝试很多不同的推理路径,并且大部分推理步骤会偏离正确答案或缺乏逻辑性。
但随着训练的推进,模型会逐步学习如何通过不断调整推理步骤来接近目标。在这个过程中,GRPO不断优化推理路径,不断提高模型的推理效率和准确性。
区别于监督学习,监督学习依赖于大量标注数据来修正模型,而GRPO通过实时的反馈和自我优化过程,让模型在推理任务中不断自我调整,从而逼近最佳的推理策略。
DeepSeek特性对AI应用的影响
虽然作为对话机器人,DeepSeek的表现是很令人惊艳的,但是从工程应用的角度,可能就不太讨人喜欢了。
举个实际例子,我有个客户是做心理相关的AI应用的,他在实际使用DeepSeek(从GPT迁移)过程中发现了两个情况:
第一,原来的提示词不好用了,模型的想法很多; 第二,DeepSeek居然有些大男子主义,这种产品上线后如果被有心人揪着不放,会挺麻烦的;
这些都会导致我们已有AI应用或者即将开展AI应用的一些问题:
一、提示词难以重用
之前我们做AI应用,无论是依赖GPT还是智谱、文心、千问...
其提示词是大同小异的,我们经常出现同一套提示词在不同的任务中来回切换,道理也很简单:模型擅长什么,我们就用他什么。
但如果使用R1做主要基座模型的话,对提示词的冲击也许不小,这会加大工程复杂度。
二、伦理与偏见
AI产品的使用远非各位想的如此简单,无论是医疗场景的幻觉,还是沟通过程中的大男子主义,都是不被允许的,都是可能被放大的。
而模型偏见通常源于训练数据中的不平衡或偏差。DeepSeek-R1虽然在推理能力上表现出色,但其训练数据可能仍然包含某些社会偏见。
GRPO框架虽然通过强化学习优化了推理步骤,但并未完全消除数据中的偏见。此外,模型在生成答案时,可能会无意中放大这些偏见,尤其是在涉及性别、种族等敏感话题时。
这对模型配套的知识库(工程控制)提出了更多的要求。
只不过这个也未必只是DeepSeek的问题,只不过他是国内暂时最好的基座模型选择,那么要求自然就会高些。
三、模型行为的不可控性
在没有标签数据的情况下进行自我改进,这可能会带来不可控性。
DeepSeek-R1在推理过程中可能尝试不同的路径,并通过奖励反馈机制进行自我调整。
然而,这种探索和试错的过程可能导致模型生成不符合期望的行为,特别是在应用场景中,当模型无法准确判断用户的需求和情境时,可能会给出不恰当的回答。
在实际应用中,尤其是在心理健康领域,模型的反应需要非常谨慎且经过深思熟虑,而GRPO的自我优化机制可能会使模型在推理过程中出现“激进”或者“过度自信”的倾向,无法准确把握情境的细微差别。
综上,都是将DeepSeek作为实际AI应用基座模型一定会遇到的问题,需要前置解决。
结语
综上,R1的提示词设计与指令型模型的不同,是其背后GRPO强化学习框架的自然延伸。
与其他模型通常依赖简单、直接的任务指令不同,DeepSeek的提示词结构更为复杂和结构化,这是由其推理优化过程所驱动的。
通过引入GRPO框架,DeepSeek不仅关注最终的推理结果,更加注重推理过程的质量和步骤优化,要求模型在任务执行的每个环节中进行自我反思和调整。
这种结构化提示词的设计方式,能够帮助模型更精准地理解任务背景、受众需求、核心目标和潜在挑战,从而提高推理的准确性和清晰度。
DeepSeek的提示词结构化,反映了其推理优化的本质,即不仅仅专注于完成任务,更强调在推理过程中如何克服挑战和提升策略。
然而,这种设计带来的优势可能也带来了工程上的挑战。
在实际应用中,尤其是在复杂和敏感的领域,如心理健康应用,DeepSeek的自我优化机制可能导致模型在推理过程中出现过于自信或不合适的行为,特别是在处理复杂情境或伦理敏感问题时。
GRPO虽然使模型具有更高的适应性,但这种灵活性也可能导致模型产生不符合预期的推理路径或偏见。
因此,如何在保持模型灵活性的同时,确保其行为的可控性和符合伦理标准,成为工程应用中的一大挑战。
知识库建设是解决这些问题的关键。通过构建更加全面、精准的知识库,不仅能够提升模型的推理能力,从而确保模型在复杂任务中能够稳定可靠地运行。
虽然R1可能有些问题,但他依旧是国内暂时最优的基座模型,而且后续肯定会有版本迭代,让子弹再飞会吧...