[翻译]为 OpenAI 的 O1 和 O3-mini 推理模型进行提示工程
这篇内容来自微软官方发布的最新文章,重点介绍了 OpenAI 的 O1 和 O3-mini 推理模型——与传统 GPT-4o 相比,它们在多步骤逻辑分析与复杂推理场景中具有明显优势。文中详解了如何为 O1/O3-mini 进行提示工程,尤其适用于法律案例分析等严谨场合。如何选择正确的模型也是写好提示词的一部分。此文信息量很大,建议您先收藏,再花时间认真阅读,深入掌握新一代深度推理模型的最佳实践。
OpenAI 的 O1 和 O3-mini 是高级“推理”模型,它们在处理提示和生成答案的方式上与基础的 GPT-4(通常称为 GPT-4o)不同。这些模型旨在花费更多时间“思考”复杂问题,模仿人类的分析方法。
本节探讨了 O1 和 O3-mini 在输入处理、推理能力和响应行为方面与 GPT-4o 的不同之处,并概述了提示工程的最佳实践以最大化其性能。最后,我们将这些最佳实践应用于法律案例分析场景。
O1/O3-mini 和 GPT-4o 之间的差异
输入结构和上下文处理
• 内置推理与提示推理: O1 系列模型具有内置的链式推理,这意味着它们可以在内部通过步骤进行推理,而无需提示的明确引导。相比之下,GPT-4o 通常需要外部指令,如“让我们一步一步思考”来解决复杂问题,因为它不会自动进行多步推理达到同样的程度。使用 O1/O3 时,你可以直接呈现问题;模型会自行深入分析。
• 对外部信息的需求: 在某些部署中,GPT-4o 拥有广泛的知识库和工具访问权限(例如浏览、插件、视觉),这有助于其处理广泛的话题。相比之下,O1 模型在其训练重点之外的知识库较窄。例如,O1-preview 在推理任务中表现出色,但由于知识背景有限,无法回答关于自身的问题。这意味着在使用 O1/O3-mini 时,如果任务超出常识范围,重要的背景信息或上下文应包含在提示中——不要假设模型知道小众事实。GPT-4o 可能已经知道法律先例或晦涩细节,而 O1 可能需要您提供该文本或数据。
• 上下文长度: 推理模型具有非常大的上下文窗口。O1 支持最多 128k 个输入标记,O3-mini 接受最多 200k 个标记(输出最多 100k 个标记),超过了 GPT-4o 的上下文长度。这允许您将大量案例文件或数据集直接输入到 O1/O3 中。对于提示工程,清晰地构建大型输入(使用章节、项目符号或标题),以便模型可以导航信息。GPT-4o 和 O1 都可以处理长提示,但 O1/O3 的更高容量意味着您可以一次性包含更详细的上下文,这在复杂分析中很有用。
推理能力和逻辑推理
• 推理深度: O1 和 O3-mini 经过优化,适合有条理的多步骤推理。它们在回答前字面上“思考更久”,从而在复杂任务上产生更准确的解决方案。例如,O1-preview 在一场具有挑战性的数学考试(AIME)中解决了 83%的问题,而 GPT-4o 仅解决了 13%——这证明了其在专业领域中卓越的逻辑推理能力。这些模型在内部执行思维链,甚至自我检查其工作。GPT-4o 也很强大,但往往更直接地产生答案;如果没有明确提示,它可能不会进行详尽的分析,从而在 O1 能够发现的非常复杂的情况下导致错误。
• 处理复杂与简单任务: 由于 O1 系列模型默认进行大量推理,它们在具有许多推理步骤的复杂问题上表现出色(例如,多方面分析,长篇证明)。事实上,在需要五个或更多推理步骤的任务中,像 O1-mini 或 O3 这样的推理模型比 GPT-4 的表现要好得多(准确率高出 16%以上)。然而,这也意味着对于非常简单的查询,O1 可能会“想得太多”。研究发现,在简单任务(少于 3 个推理步骤)中,O1 的额外分析过程可能成为劣势——在相当一部分情况下,由于过度推理,它的表现不如 GPT-4。GPT-4o 可能更直接和迅速地回答简单问题,而 O1 可能会产生不必要的分析。关键区别在于 O1 是为复杂性校准的,因此在琐碎的问答中可能效率较低。
• 逻辑推理风格: 在涉及谜题、演绎推理或逐步解决问题时,GPT-4o 通常需要通过提示工程逐步进行(否则可能会直接跳到答案)。O1/O3 以不同的方式处理逻辑推理:它们模拟内部对话或草稿。对于用户来说,这意味着 O1 的最终答案往往有充分的理由支持,不易出现逻辑漏洞。它会在内部有效地进行“思维链”以双重检查一致性。从提示的角度来看,通常不需要告诉 O1 解释或检查其逻辑——它会在给出答案前自动进行这些操作。对于 GPT-4o,你可能需要包括诸如“首先列出假设,然后得出结论”之类的指令以确保严谨的逻辑;而对于 O1,这类指令通常是多余的,甚至可能适得其反。
响应特性和输出优化
• 细节和冗长: 由于其深入的推理,O1 和 O3-mini 通常会为复杂查询生成详细、结构化的答案。例如,O1 可能会将数学解题过程分解为多个步骤,或为策略计划的每个部分提供理由。而 GPT-4o 则可能默认给出更简洁的答案或高级概述,除非被要求详细说明。在提示工程方面,这意味着** O1 的回答可能更长或更技术化**。您可以通过指令更好地控制这种冗长性。如果您希望 O1 简洁,必须明确告知(就像对 GPT-4 一样)——否则,它可能会倾向于详尽。相反,如果您希望输出中有逐步解释,可能需要告诉 GPT-4o 包含一个,而 O1 如果被要求则会乐于提供(并且无论如何可能已经在内部进行了推理)。
• 准确性和自我检查: 推理模型表现出一种自我事实核查的形式。OpenAI 指出,O1 在生成响应时更能发现自己的错误,从而提高复杂响应的事实准确性。GPT-4o 通常是准确的,但如果没有引导,偶尔可能会自信地出错或幻觉事实。O1 的架构通过在“思考”时验证细节来降低这种风险。在实践中,用户观察到 O1 在处理棘手问题时产生的错误或无意义答案较少,而 GPT-4o 可能需要提示技巧(如要求其批评或验证其答案)才能达到相同的信心水平。这意味着你通常可以信任 O1/O3 通过简单的提示来正确回答复杂问题,而对于 GPT-4,你可能需要添加诸如“检查你的答案是否与上述事实一致”的指令。不过,两个模型都不是万无一失的,因此关键的事实输出应始终进行审查。
• 速度和成本: 一个显著的区别是,O1 模型速度较慢且更昂贵,以换取其更深层次的推理。O1 Pro 甚至为长查询提供了进度条。GPT-4o 在处理典型查询时往往响应更快。O3-mini 的推出是为了提供一个更快、更具成本效益的推理模型——每个 token 的成本比 O1 或 GPT-4o 便宜得多,并且延迟更低。然而,O3-mini 是一个较小的模型,因此虽然在 STEM 推理方面很强,但在一般知识或极其复杂的推理方面可能无法与完整的 O1 或 GPT-4 相匹敌。在为最佳响应性能进行提示工程时,需要在深度与速度之间取得平衡:O1 可能需要更长时间来彻底回答。如果延迟是一个问题且任务不是最大复杂度,O3-mini(甚至 GPT-4o)可能是更好的选择。OpenAI 的指导意见是,GPT-4o“仍然是大多数提示的最佳选择”,主要在策略、数学和编码等领域使用 O1 来解决真正困难的问题。简而言之,使用合适的工具来完成工作——如果使用 O1,预计会有较长的响应时间,并计划其较慢的输出(可能通过通知用户或调整系统超时来应对)。
提示工程技术以最大化性能
有效利用 O1 和 O3-mini 需要采用与 GPT-4o 略有不同的提示方法。以下是从这些推理模型中获得最佳结果的关键提示工程技术和最佳实践:
保持提示清晰简洁
提出要求时要简明直接。因为 O1 和 O3 进行密集的内部推理,它们对没有多余文本的专注问题或指令反应最佳。OpenAI 和最近的研究建议避免对这些模型使用过于复杂或引导性的提示。实际上,这意味着你应该简单陈述问题或任务,并仅提供必要的细节。无需添加“冗余”或多次重述查询。例如,与其写:“在这个具有挑战性的谜题中,我希望你仔细推理每一步以达到正确的解决方案。让我们逐步分解……”,不如简单地问:“解决以下谜题[包括谜题细节]。解释你的推理。”模型会自然地进行逐步思考并给出解释。过多的指令实际上可能使事情复杂化——一项研究发现,添加过多的提示上下文或过多的示例会降低 O1 的性能,基本上使其推理过程不堪重负。提示:对于复杂任务,从零样本提示(仅任务描述)开始,只有在发现输出不符合需求时才添加更多指令。通常,最小化提示会在这些推理模型中产生最佳结果。
避免不必要的少样本示例
传统的 GPT-3/4 提示工程通常使用少量示例或演示来引导模型。然而,对于 O1/O3,少即是多。O1 系列明确训练为不需要充满示例的提示。事实上,使用多个示例可能会影响性能。对 O1-preview 和 O1-mini 的研究表明,少量提示始终会降低其性能——即使是精心选择的示例在许多情况下也会使其表现不如简单提示。内部推理似乎会被示例分散注意力或限制。OpenAI 自己的指导意见与此一致:他们建议限制推理模型的额外上下文或示例,以避免混淆其内部逻辑。最佳实践:使用零示例或最多一个示例(如果绝对需要)。如果包含示例,请确保其高度相关且简单。例如,在法律分析提示中,通常不会在前面附加完整的案例分析;而是直接询问新案例。唯一可能使用演示的情况是任务格式非常具体且模型未遵循指令——此时展示一个简短的期望格式示例。否则,信任模型从直接查询中找出答案。
利用系统/开发者说明进行角色和格式设置
设定明确的教学背景可以帮助引导模型的响应。在 API 中(或在对话的系统消息中),简洁地定义模型的角色或风格。例如,系统消息可能会说:“你是一位逐步解释解决方案的专家科学研究员”。O1 和 O3-mini 对这样的角色指令反应良好,并会在其推理中加以体现。然而,请记住,它们已经擅长理解复杂任务,因此您的指令应侧重于您想要的输出类型,而不是如何思考。系统/开发者指令的良好使用包括:
• 定义任务范围或角色: 例如,“作为法律分析师”或“以数学老师向学生解释的方式解决问题。”这可以影响语气和细节程度。
• 指定输出格式: 如果您需要以结构化形式(项目符号、表格、JSON 等)提供答案,请明确说明。O1 和特别是 O3-mini 支持结构化输出模式,并将遵循格式要求。例如:“请将您的发现以关键要点列表的形式提供。” 由于它们的逻辑性,它们倾向于准确地遵循格式说明,这有助于保持响应的一致性。
• 设定界限: 如果你想控制冗长或专注,可以包括类似“在详细分析后提供简要结论”或“仅使用给定的信息,不做外部假设”的内容。推理模型将尊重这些界限,这可以防止它们偏离主题或臆造事实。这很重要,因为 O1 可能会产生非常详尽的分析——这通常很好,但如果你明确只需要一个总结,则不然。
确保每次都包含有关语气、角色、格式的任何指导。
通过指令控制详细程度和深度
虽然 O1 和 O3-mini 自然会进行深入推理,但你可以控制这些推理在输出中反映的程度。如果你想要详细的解释,可以提示(例如,“在答案中展示逐步推理”)。他们不需要推动就能进行推理,但如果你想看到推理过程,需要告知他们。相反,如果你觉得模型的答案过于冗长或技术性不符合你的目的,可以指示它更简洁或只关注某些方面。例如:“用 2-3 段总结分析,仅包含最关键的点。”这些模型通常会服从关于长度或重点的指示。请记住,O1 的默认行为是全面的——它优化的是正确性而非简洁性——因此可能倾向于提供更多细节。大多数情况下,直接要求简洁会覆盖这种倾向。
对于 O3-mini,OpenAI 提供了一个额外的工具来管理深度:“推理努力”参数(低、中、高)。此设置让模型知道需要多努力地“思考”。在提示术语中,如果使用 API 或暴露此功能的系统,可以在非常复杂的任务中调高(确保最大推理,但代价是更长的答案和延迟),或在简单任务中调低(更快、更简洁的答案)。这实际上是控制冗长和彻底性的另一种方式。如果您没有直接访问该参数,可以通过明确说明“给出快速答案而不进行深入分析”来模拟低努力模式,以应对速度比完美准确性更重要的情况。相反,为了模拟高努力,您可以说“采取所有必要步骤以得出正确答案,即使解释很长”。这些提示与模型的内部设置操作方式一致。
确保复杂任务的准确性
为了在解决困难问题时获得最准确的回答,请在提示中利用推理模型的优势。由于 O1 可以自我检查甚至发现矛盾,您可以要求它利用这一点:例如,“分析所有事实并双重检查你的结论是否一致。” 通常情况下,它会在没有提示的情况下这样做,但强化这一指令可以提醒模型更加小心。有趣的是,因为 O1 已经自我事实核查,您很少需要提示它“验证每一步”(这对 GPT-4o 更有帮助)。相反,专注于提供完整和明确的信息。如果问题或任务有潜在的歧义,请在提示中澄清它们或指示模型列出任何假设。这可以防止模型错误猜测。
处理来源和数据:如果您的任务涉及分析给定数据(如总结文档或从提供的数字中计算答案),请确保数据清晰呈现。O1/O3 将认真使用它。您甚至可以将数据分成要点或表格以提高清晰度。如果模型不能幻想(例如,在法律背景下不应编造法律),请明确说明“仅根据提供的信息和常识回答;不要编造任何细节。”推理模型通常擅长坚持已知事实,这样的指示进一步减少了幻想的可能性。
迭代和验证:如果任务至关重要(例如,复杂的法律推理或高风险的工程计算),一种提示工程技术是集成模型的响应。这不是单一提示,而是一种策略:您可以多次运行查询(或要求模型考虑替代解决方案),然后比较答案。O1 的随机性意味着它每次可能探索不同的推理路径。通过比较输出或在后续提示中要求模型“反思是否有其他解释”,可以提高对结果的信心。虽然 GPT-4o 也能从这种方法中受益,但当绝对准确性至关重要时,这对 O1 尤其有用——本质上是通过交叉验证利用模型自身的深度。
最后,请记住,模型选择是提示工程的一部分:如果一个问题实际上不需要 O1 级别的推理,使用 GPT-4o 可能更高效且同样准确。OpenAI 建议将 O1 保留用于困难的情况,并在其他情况下使用 GPT-4o。所以一个元提示:首先评估任务的复杂性。如果很简单,要么非常直接地提示 O1 以避免过度思考,要么切换到 GPT-4o。如果很复杂,则利用上述技术发挥 O1 的能力。
O1/O3 如何处理逻辑推理与 GPT-4o 的对比
这些推理模型处理逻辑问题的方式与 GPT-4o 根本不同,因此您的提示策略应相应调整:
• 内部思维链:O1 和 O3-mini 有效地进行内部对话或逐步解决问题,因为它们推导出答案。除非明确指导,否则 GPT-4o 可能不会严格地逐步进行。例如,在逻辑谜题或数学文字题中,GPT-4o 可能会给出一个听起来合理但跳过一些推理的快速答案,从而增加错误的风险。O1 会自动分解问题,考虑各种角度,然后才给出答案,这就是为什么它在逻辑密集型评估中取得显著更高分数的原因。提示差异:不要提示 O1“展示推理”,除非你真的想看到它。对于 GPT-4o,你会使用 CoT 提示(“首先,考虑……然后……”)来改善推理,但对于 O1,这个功能是内置的,外部要求它这样做可能是多余的,甚至令人困惑。相反,只需确保问题陈述清楚,让 O1 进行演绎推理。
• 处理歧义:在逻辑推理任务中,如果有缺失信息或歧义,GPT-4o 可能会即兴做出假设。O1 更可能标记歧义或考虑多种可能性,因为其反思性的方法。为了利用这一点,你可以直接在提示中对 O1 说:“如果有任何不确定性,请在解决之前说明你的假设。”GPT-4 可能更需要这种提醒。O1 可能会自然地这样做,或者至少不太容易假设未给出的事实。因此,在比较两者时,O1 的推理是谨慎和全面的,而 GPT-4o 的推理是快速和广泛的。根据需要调整你的提示——对于 GPT-4o,引导其小心;对于 O1,你主要需要提供信息并让其自行处理。
• 逐步输出:有时你实际上希望输出中包含逻辑步骤(用于教学或透明性)。使用 GPT-4o 时,你必须明确要求这一点(“请展示你的工作”)。如果问题足够复杂,O1 可能会默认包含结构化的理由,但通常它会给出一个经过深思熟虑的答案,而不会明确列举每个步骤,除非被要求。如果你希望 O1 输出逻辑链,只需指示它即可——这对它来说毫无困难。事实上,据说 O1-mini 在提示时能够提供逐步分解(例如,在编码问题中)。同时,如果你不想要 O1 的长篇逻辑阐述(也许你只想要最终答案),你应该说“直接给出最终答案”以跳过冗长的解释。
• 逻辑严谨性与创造力:还有一个区别:GPT-4(和 4o)具有创造力和生成能力。有时在逻辑问题中,这可能导致它“想象”场景或类比,这并不总是需要的。O1 更注重严谨性,会坚持逻辑分析。如果你的提示涉及需要推理和一点创造力的场景(比如通过拼凑线索和添加叙述来解决谜题),GPT-4 可能更擅长处理叙述,而 O1 将严格专注于推理。在提示工程中,你可以结合它们的优势:使用 O1 获得逻辑解决方案,然后使用 GPT-4 润色呈现。如果仅使用 O1/O3,请注意你可能需要明确要求它进行创造性的修饰或更具想象力的回应——它们会优先考虑逻辑和正确性。
关键调整:总之,为了利用 O1/O3 的逻辑优势,给他们最困难的推理任务作为一个明确的提示。让他们在内部磨练逻辑(他们为此而生)而不对其思维过程进行微观管理。对于 GPT-4o,继续使用经典的提示工程(分解问题,要求逐步推理等)以引导出同样水平的推理。并且始终将提示风格与模型匹配——由于它们不同的推理方法,可能会让 GPT-4o 感到困惑的提示对 O1 来说可能正合适,反之亦然。
撰写有效提示:最佳实践总结
为了将上述内容整合为可操作的指南,以下是提示 O1 或 O3-mini 时的最佳实践清单:
• 使用清晰、具体的指令:明确说明你希望模型做什么或回答什么。避免不相关的细节。对于复杂的问题,简单直接的提问通常就足够了(无需复杂的角色扮演或多问题提示)。
• 提供必要的背景信息,省略其余部分:包括模型需要的任何领域信息(案件事实、数学问题的数据等),因为模型可能没有最新或小众的知识。但不要用不相关的文本或过多的例子过载提示——多余的内容可能会削弱模型的注意力。
• 最少或没有少样本示例:默认情况下,从零样本提示开始。如果模型误解了任务或格式,你可以添加一个简单的示例作为指导,但绝不要为 O1/O3 添加长链示例。他们不需要这样做,这甚至可能降低性能。
• 设置角色或语气(如有需要):使用系统消息或简短前缀来让模型进入正确的思维模式(例如,“你是一名分析案件的高级法律书记员。”)。这尤其有助于语气(正式与非正式)并确保领域适用的语言。
• 指定输出格式:如果您希望答案以特定结构(列表、大纲、JSON 等)呈现,请明确告知模型。推理模型将可靠地遵循格式说明。例如:“将您的答案按步骤顺序列出。”
• 通过指令控制长度和细节:如果你想要简短的回答,请说明(“用一段话回答”或“只给出是/否并用一句话解释”)。如果你想要深入的分析,请鼓励这样做(“提供详细的解释”)。不要假设模型默认知道你想要的细节程度——请指示它。
• 利用 O3-mini 的推理努力设置:通过 API 使用 O3-mini 时,为任务选择合适的 reasoning_effort(低/中/高)。高会提供更全面的答案(适合复杂的法律推理或困难的数学),低会提供更快、更简短的答案(适合快速检查或简单查询)。这是为 O3-mini 调整提示行为的一种独特方式。
• 避免冗余的“逐步思考”提示:不要为 O1/O3 添加诸如“让我们仔细思考”或连锁思维指令之类的短语;模型已经在内部执行这些操作。节省这些标记,仅在 GPT-4o 上使用此类提示,因为它们有影响。例外情况可能是如果您明确希望模型输出每个步骤以提高透明度——那么您可以在输出中要求这样做,但仍然不需要告诉它实际执行推理。
• 测试和迭代:因为这些模型对措辞可能很敏感,如果你没有得到好的答案,可以尝试重新措辞问题或收紧指令。你可能会发现稍微改变一下(例如,直接提问与开放式提示)会产生显著更好的响应。幸运的是,O1/O3 对迭代的需求比旧模型少(它们通常能一次性完成复杂任务),但调整提示仍然有助于优化清晰度或格式。
• 验证重要输出:对于关键用例,不要依赖单一的提示-回答循环。使用后续提示要求模型验证或证明其答案(“你对这个结论有信心吗?解释原因。”),或者再次运行提示以查看是否获得一致的结果。一致性和充分理由的答案表明模型的推理是可靠的。
通过遵循这些技术,您可以充分利用 O1 和 O3-mini 的全部功能,并获得高度优化的响应,发挥它们的优势。
将最佳实践应用于法律案件分析
最后,让我们考虑这些提示工程指南如何转化为法律案件分析场景(如前所述)。法律分析是复杂推理任务的完美例子,在这种情况下,O1 可以非常有效,前提是我们精心设计提示:
• 结构化输入:首先清晰地列出案件的关键事实和需要回答的法律问题。例如,将背景事实列为要点或简短段落,然后明确提出法律问题:“鉴于上述事实,确定甲方是否根据美国法律对违反合同负责。” 以这种方式结构化提示可以使模型更容易解析场景,也确保没有关键细节被埋没或忽视。
• 提供相关背景或法律:如果特定法规、案例先例或定义相关,请在提示中包含它们(或其摘要)。O1 没有浏览功能,可能无法从记忆中回忆起小众法律,因此如果您的分析依赖于某个特定法律的文本,请提供给模型。例如:“根据[法规 X 摘录],[提供文本]……将此法规应用于案例。”这样,模型就有必要的工具来进行准确推理。
• 在系统消息中设置角色:像“你是一名法律分析师,以清晰、循序渐进的方式解释法律在事实中的应用”这样的系统指令将提示模型生成正式、合理的分析。虽然 O1 已经会尝试进行仔细的推理,但此指令使其语气和结构与我们在法律话语中所期望的一致(例如引用事实、应用法律、得出结论)。
• 无需多个示例:不要提供完整的案例分析作为提示(这可能是你在使用 GPT-4o 时会考虑的)。O1 不需要示例来参考——它可以从头开始进行分析。不过,你可以简要提及所需的格式:“请以 IRAC 格式(问题、规则、分析、结论)提供答案。”这种格式说明提供了一个模板,而无需展示冗长的示例,O1 将据此组织输出。
• 根据需要控制详细程度:如果您想要对案件进行详细分析,让 O1 输出其全面的推理。结果可能是几段深入探讨每个问题的文字。如果您觉得输出过于冗长或者特别需要简洁的摘要(例如,快速的咨询意见),请指示模型:“将分析保持在几个关键段落,集中于核心问题。” 这样可以确保您只获得主要要点。另一方面,如果初步答案显得过于简短或肤浅,您可以再次提示:“详细解释,特别是如何将法律应用于事实。” O1 会乐于详细说明,因为它已经在内部进行了深入推理。
• 准确性和逻辑一致性:法律分析要求在将规则应用于事实时具有准确性。使用 O1,您可以信任其逻辑地解决问题,但明智的做法是仔细检查其引用的任何法律条文或具体主张(因为其训练数据可能没有每个细节)。您甚至可以在末尾添加提示,例如,“请仔细检查所有事实是否已被处理,结论是否符合法律。” 鉴于 O1 的自我检查倾向,它可能会指出如果有不一致或需要额外假设的地方。在细微差别很重要的领域中,这是一个有用的安全网。
• 使用后续查询:在法律场景中,通常会有后续问题。例如,如果 O1 给出了一个分析,你可能会问:“如果合同有一个不同的终止条款,那会如何改变分析?”O1 可以很好地处理这些迭代问题,延续其推理。只需记住,如果你正在进行的项目中,界面在当前对话上下文之外没有长期记忆(也不能浏览),每个后续问题要么依赖于提供的上下文,要么包括任何需要的新信息。保持对话集中在手头的案件事实上,以防止混淆。
通过应用这些最佳实践,您的提示将引导 O1 或 O3-mini 提供高质量的法律分析。总之,清晰地呈现案例,明确任务,并让推理模型承担繁重的工作。结果应该是一个经过深思熟虑的、逐步的法律讨论,利用 O1 的逻辑能力,并通过有效的提示构建进行优化。
以这种方式使用 OpenAI 的推理模型可以让您在复杂问题解决中利用其优势,同时保持对输出风格和清晰度的控制。正如 OpenAI 自己的文档所述,O1 系列在研究和策略等领域的深度推理任务中表现出色——法律分析同样受益于这一能力。通过了解与 GPT-4o 的差异并相应调整您的提示方法,您可以最大化 O1 和 O3-mini 的性能,即使是最具挑战性的推理任务也能获得准确、结构良好的答案。
Prompt Engineering for OpenAI’s O1 and O3-mini Reasoning Models[1]
引用链接
[1] Prompt Engineering for OpenAI’s O1 and O3-mini Reasoning Models: https://techcommunity.microsoft.com/blog/azure-ai-services-blog/prompt-engineering-for-openai%E2%80%99s-o1-and-o3-mini-reasoning-models/4374010