alitrack

GPT Researcher:27K Star,CMU 评测击败 Perplexity 的开源 Deep Research Ag

GPT Researcher:27K Star,CMU 评测击败 Perplexity 的开源 Deep Research Ag

如果你做过文献综述,你一定经历过这个循环:打开 Google Scholar → 点开 37 个标签页 → 读了三篇发现都不是你想要的 → 再搜 → 再点 → 一个下午过去了,笔记只写了三行。
AI 时代的"帮你搜"工具不少,但大多数只是在你的 query 后面偷偷加了个 site:arxiv.org,扔给你一堆论文链接——叫你自己看。这不叫"研究",这叫"高级搜索"。
真正的深度研究,是 Agent 自己去搜、去读、去比对、去总结,最后交给你一份带引用的结构化报告。
这就是 GPT Researcher 在做的事。

它是什么

GPT Researcher 是哥伦比亚大学研究员 Assaf Elovic 开发的开源 Deep Research Agent,GitHub 27.3K Star。它的定位非常明确:一个自主执行深度研究的 AI Agent,而不是 ChatGPT 套壳。
核心区别:你给一个课题,它自己规划研究路径、并行搜索多个来源、交叉验证信息、合成带引用的最终报告。全程不需要你"喂"资料。

架构:不是聊天机器人,是三阶段的 Agent 管线

GPT Researcher 的内部架构是一个Planner → Execution → Publisher 的三阶段管线,而非"用户提问 → LLM 回答"的聊天模式:
第一阶段:Planner Agent 拆解问题
收到你的研究课题后,Planner 先把它拆成一组子问题。比如你问"量子计算在药物研发中的应用现状",它会拆成:

  • 量子计算在分子模拟中有哪些突破?
  • 哪些药企已经投入量子计算?
  • 技术瓶颈在哪里?
  • 与传统方法相比优势多大?

第二阶段:Execution Agents 并行搜索
每个子问题独立派给一个 Execution Agent,各自去搜索、抓取网页、阅读内容、提取关键信息。多个 Agent 并行跑,而不是"搜一个→读完→再搜下一个"的串行模式。
这一步是它和 Perplexity 类产品的核心差异——Perplexity 是一次性搜索后直接回答,GPT Researcher 是递归深入的:每个子问题的结果可能再拆出更细的子问题,形成树状探索。
第三阶段:Publisher Agent 聚合输出
所有 Execution Agent 的结果汇总给 Publisher,它会交叉验证信息(多个来源都提到的内容权重更高),生成结构化的最终报告。输出格式支持 PDF、Word、Markdown。
这套三阶段设计来自两篇关键论文的启发:Plan-and-Solve(先规划再执行)和 STORM(多 Agent 协作写作)。底层用 LangGraph 和 AG2 做 Agent 编排。

CMU 评测:真的比 Perplexity 强吗?

2025 年 5 月,CMU 发布了 DeepResearchGym 基准——1000 个复杂研究任务,横跨多个领域,评测了市面上所有主流 Deep Research 工具。
结果:

维度GPT ResearcherPerplexityOpenAIHuggingFace
引用精度85.36%≤80%≤80%≤75%
引用召回率90.82%———
报告清晰度83.70%———
报告洞察力78.01%———
关键信息覆盖率64.67%———

GPT Researcher 在所有五个维度都拿了第一。尤其是引用精度 85.36% 和召回率 90.82%——它是唯一在"引用"这个维度上双双超过 85% 的工具。
但别急着庆祝。85% 的引用精度意味着每 7 条引用中仍有 1 条可能有问题。对学术写作来说,这个数字不够——你必须逐条核对。

不只是"Web 搜索",它还能读你本地的论文

GPT Researcher 支持本地文档研究。设置 export DOC_PATH=/path/to/papers 后,它会把你的 PDF、Word、PPT、Excel 纳入研究范围。
这意味着你可以用它做混合研究:同时搜最新的 web 资料和你积累的本地论文库,生成带双重来源引用的报告。
支持 100+ LLM,包括 OpenAI、Anthropic、Gemini,以及通过 Ollama 运行的本地模型。用本地模型跑的话,零 API 费用,但报告质量会下降。

快速上手

安装过程出奇简单——比大多数同类项目清爽得多:

1git clone https://github.com/assafelovic/gpt-researcher
2cd gpt-researcher
3pip install -r requirements.txt

配置 .env 文件,至少需要两个 key:

1OPENAI_API_KEY=sk-xxx
2TAVILY_API_KEY=tvly-xxx

然后:

1python main.py

浏览器打开 localhost:8000,就是它的 Web 界面。也支持纯 CLI 和 Python API 调用,Docker 部署也官方支持。
如果不想装,可以直接在 Colab 上跑。

深度研究模式:自动下钻

这是它的杀手功能。普通模式下它搜一轮就写报告,Deep Research 模式会递归深入:

  1. 首轮搜索 → 发现新的子课题
  2. 对每个子课题再做搜索 → 发现更细的子课题
  3. 直到达到预设的深度或广度上限

可以配置 depth(深度,默认 2 层)和 breadth(每层几个分支,默认 4 个)。设 depth=3, breadth=5 的话,最多会产生 5 + 25 + 125 = 155 次子搜索——这就是为什么深度研究比普通搜索贵得多。
Deep Research 模式默认用 OpenAI 的 o3-mini 做推理——因为递归拆解和交叉验证需要较强推理能力。

竞品对比

工具定位Stars亮点短板
GPT Researcher通用 Deep Research Agent27KCMU 评测第一,三阶段管线需要配置 API key
GPT Academic(中科院)ChatGPT 学术优化 UI70K论文润色、翻译、一键 Arxiv本质是 UI 壳,不是 Agent
AI-Researcher(港大)全自动科研管线较新从文献调研到论文撰写全流程偏重实验验证,通用性不足
OpenScholar(Allen AI)科学文献 RAG~5K论文检索增强生成只做检索,不写报告
Perplexity Deep Research商业 Deep Research—速度快,无需配置闭源,免费次数有限

核心差异:GPT Academic 是"给你一个好用的 ChatGPT 学术界面";GPT Researcher 是"让 Agent 替你做研究"。前者帮你写得更好,后者帮你想得更深。

诚实地说:它不适合谁

不适合拿来直接写学术论文。GPT Researcher 生成的是"研究报告"——有引用、有结构、有分析,但它没有 LaTeX 模板、不会管理参考文献、不懂期刊投稿格式。它是你的研究助理,不是你的代笔。
引用幻觉仍然存在。虽然 CMU 测试引用精度 85%,但 15% 的误差率在学术场景下是致命的。每一条引用你都必须打开原文验证。不验证就交,等着被审稿人挂。
API 费用不低。一次 Deep Research(depth=2, breadth=4)大约产生 30+ 次 LLM 调用和 20+ 次搜索 API 调用,整体花费在 $0.5-$3 之间——取决于深度、广度和模型选择。用 o3-mini 比 gpt-4o-mini 贵 3-5 倍,但推理质量确实更好。
不是"一键出奇迹"。它的输出最适合作为初稿起点——你拿到报告后,还需要读原始文献、补充细节、调整论证、修正错误。期待它直接产出可投稿论文是不现实的。

它适合谁

  • 研究生做文献综述,需要快速了解一个领域的现状
  • 需要写行业报告、竞品分析、技术调研的从业者
  • 跨领域研究者,需要快速进入一个新方向
  • 日常需要做"深度信息整理"的知识工作者

一句话总结:GPT Researcher 是给研究者的"侦察兵",不是"特种兵"。它负责侦查地形、标记要点、画出草图——真正的攻坚,还是得你自己来。

参考:GPT Researcher GitHub | 官网 gptr.dev | DeepResearchGym 论文