叶小钗

Deep Research VS Manus,大力出奇迹or土专家?

关注公众号回复1

获取一线、总监、高管《管理秘籍》

2月底,OpenAI大概是为了反击DeepSeek-R1的深度思考,不得已推出了一项Deep Research功能,作为GPT深度使用用户,我在一天内给他用完了...

不得不说,在表现上Deep Research称得上足够专业,他会像人类专家一样对复杂任务进行逐步拆解,然后在互联网上进行多轮的信息搜索与验证。

会根据已有的信息逐步调整研究方向和策略,不断深入挖掘问题的本质,直到找到最合适的答案。

一般来说,后发模型一定优于前者,只不过这次OpenAI非常罕见的与R1进行了对比(这里显然将他当做了对手),然后也非常骄傲的宣称是R1的2.8倍...

至于效果,这里先说结论:差点意思,没解决我的问题,以下是我实际研究结果。

一次复杂的工程

我的工作是想要去整理所有的医疗信息,这显然是一项复杂的工程,为了降低难度,我更改了问题,从信息转变成了信息渠道的发布者:

梳理所有的医疗信息发布渠道,并且按权威性排序,基于这个问题,我开始了Deep Research之旅,这里我先是给了一些输入:

我要完成《医疗信息产出渠道全景分级体系》。

其目的是将所有可能产出医疗信息的机构全部包含,并且进行分级,需要遵循MECE原则

PS:真实提示词会严谨很多,但有一定密度就不放出来了

在多次提示、反复的情况下,GPT给了我以下反馈:

Image
Image

不用细看了,有很大问题,连最基础的医疗教科书都没有...

在明知道他有问题的情况下,我开始了反复暗示:是否有遗漏,很可惜系统都没有给我满意的答复。

而后在我明示的情况下,他终于将医学教材加入:

Image

于是我继续质疑,是否还有遗漏,但连续等了两个近10分钟,GPT依旧十分嘴硬!

不得已我只能继续提示:是否药厂很多信息没有暴露,因为很多大型药企会经常发布新药,其中会涉及大量药品信息,比如新冠相关药物的一些说明...

于是GPT恍然大悟,继续梳理,而不一会我深度研究的次数就耗尽了:

Image

但问题并未得到解决,最终只好与“不听话的DeepSeek-R1”继续纠缠...

综上,在每个问题耗时5-15分钟以后,GPT的Deep Research对于过于复杂的问题,是难以独立完成任务的。

然后,Deep Research黑盒依旧不少,真实体验下来并不比DeepSeek-R1来得高明太多,只不过看上去阵仗特别大...

Image

换句话说,简单任务犯不着用Deep Research,复杂任务又指望不少,在这个基础上,上表的结果我只能认为可能是测试题目进行了精心挑选了...

Agent or SOPs

OpenAI 强调 Deep Research 是一个模型,并不是基于o3叠加一堆工作量:

用户提问时,Deep Research像经验丰富的研究员,首先主动搜索并提取初步结果,深入分析信息质量和相关性。如果结果不足,Deep Research会调整搜索关键词,重新探索相关信息。

相比之下,传统AI搜索通过将问题拆解为关键词,依赖外部API返回结果,再由模型进行总结提炼,这种方式效率较低,难以有效过滤低质量信息。

在行业调研中,Deep Research提供可靠数据源并能推算新趋势,虽然偶尔出现幻觉现象,但总体较少。

说实话,就过往经历,我还更期待其叠加了大量SOP呢,比如进来有点小火的Manus(Agent平台),反正从测评来说“他又超过了OpenAI了”:

Image

在实际使用过程中,可以得出一个结论:在Manus擅长了领域,他的体验是优于research的,而其是否擅长又要取决于整体的意图识别,以及意图识别后的SOP成熟度了。

举个例子,我如果基于o3写一套SOP去实现筛选某行业全量的信息渠道,其结果暂时来说一定比research好,这就是KnowHow的威力。

结语

当我们将视线从平台竞争回归技术本质,Agent发展的核心矛盾便清晰浮现:

通用模型的自主探索能力与领域专用SOP的确定性控制,究竟何种路径更能支撑复杂任务的可靠交付?

从医疗信息渠道分级的实践来看,答案已然显现:暂时真正创造价值的Agent,本质是领域知识工作流(SOP)的工程化封装。

OpenAI引以为傲的Deep Research机制,暴露出通用模型在复杂系统构建中的根本局限:

  1. 认知框架缺失:面对医疗信息分级这类需要先验知识体系的任务,模型缺乏对"权威性"的元认知标准,导致医学教材等核心要素的遗漏;
  2. 验证机制脆弱:所谓的"多轮搜索验证"实为局部信息修补,无法建立全局MECE框架,最终呈现的层级体系存在结构性缺陷;
  3. 领域适应性差:当我暗示"药企信息缺失"时,系统仅做增量补充而非重构体系,暴露出对医疗产业链的深层理解不足;

这种探索-修补模式,本质上是用统计概率逼近领域逻辑,在需要严格演绎推理的场景中必然遭遇天花板。

而典型SOP Agent采用"LLM+规则引擎+领域知识库"的三层架构:

  1. LLM负责自然语言理解与生成;
  2. 规则引擎确保流程合规性;
  3. 知识库提供结构化领域数据;

这种设计在医疗渠道分级任务中,可预先植入WHO信息发布规范、各国医疗监管体系等结构化知识,其答案会更为准确(但因为时间投入较少,其到底能到哪一步,我也不能确定)。

回到根本问题:当我们在讨论Agent时,本质上在讨论什么?

从用户医疗分级任务的实践来看,答案不是更聪明的模型,而是领域问题求解方法的工业化封装。这种封装需要:

  1. 标准化接口(输入/输出规范);
  2. 模块化组件(子任务处理单元);
  3. 可验证流程(质量控制系统);

这些要素的集合,正是行业KnowHow及SOP的本质。

而那些宣称超越SOP的自主研究系统,在真实复杂任务中的笨拙表现,恰恰证明:没有领域知识框架支撑的“智能”,不过是无根之木。

我认为未来Agent的发展,必将是SOP范式持续进化之路。

用更灵活的框架容纳模型进步,用更严谨的工程思维约束技术幻觉,最终实现从人工定义流程到流程自我进化的质变。

但在此之前,脚踏实地完善SOP的工程化体系,才是穿越技术迷雾的理性选择。

Image