GPT Researcher:27K Star,CMU 评测击败 Perplexity 的开源 Deep Research Ag
GPT Researcher:27K Star,CMU 评测击败 Perplexity 的开源 Deep Research Ag
如果你做过文献综述,你一定经历过这个循环:打开 Google Scholar → 点开 37 个标签页 → 读了三篇发现都不是你想要的 → 再搜 → 再点 → 一个下午过去了,笔记只写了三行。
AI 时代的"帮你搜"工具不少,但大多数只是在你的 query 后面偷偷加了个 site:arxiv.org,扔给你一堆论文链接——叫你自己看。这不叫"研究",这叫"高级搜索"。
真正的深度研究,是 Agent 自己去搜、去读、去比对、去总结,最后交给你一份带引用的结构化报告。
这就是 GPT Researcher 在做的事。
它是什么
GPT Researcher 是哥伦比亚大学研究员 Assaf Elovic 开发的开源 Deep Research Agent,GitHub 27.3K Star。它的定位非常明确:一个自主执行深度研究的 AI Agent,而不是 ChatGPT 套壳。
核心区别:你给一个课题,它自己规划研究路径、并行搜索多个来源、交叉验证信息、合成带引用的最终报告。全程不需要你"喂"资料。
架构:不是聊天机器人,是三阶段的 Agent 管线
GPT Researcher 的内部架构是一个Planner → Execution → Publisher 的三阶段管线,而非"用户提问 → LLM 回答"的聊天模式:
第一阶段:Planner Agent 拆解问题
收到你的研究课题后,Planner 先把它拆成一组子问题。比如你问"量子计算在药物研发中的应用现状",它会拆成:
- 量子计算在分子模拟中有哪些突破?
- 哪些药企已经投入量子计算?
- 技术瓶颈在哪里?
- 与传统方法相比优势多大?
第二阶段:Execution Agents 并行搜索
每个子问题独立派给一个 Execution Agent,各自去搜索、抓取网页、阅读内容、提取关键信息。多个 Agent 并行跑,而不是"搜一个→读完→再搜下一个"的串行模式。
这一步是它和 Perplexity 类产品的核心差异——Perplexity 是一次性搜索后直接回答,GPT Researcher 是递归深入的:每个子问题的结果可能再拆出更细的子问题,形成树状探索。
第三阶段:Publisher Agent 聚合输出
所有 Execution Agent 的结果汇总给 Publisher,它会交叉验证信息(多个来源都提到的内容权重更高),生成结构化的最终报告。输出格式支持 PDF、Word、Markdown。
这套三阶段设计来自两篇关键论文的启发:Plan-and-Solve(先规划再执行)和 STORM(多 Agent 协作写作)。底层用 LangGraph 和 AG2 做 Agent 编排。
CMU 评测:真的比 Perplexity 强吗?
2025 年 5 月,CMU 发布了 DeepResearchGym 基准——1000 个复杂研究任务,横跨多个领域,评测了市面上所有主流 Deep Research 工具。
结果:
| 维度 | GPT Researcher | Perplexity | OpenAI | HuggingFace |
|---|---|---|---|---|
| 引用精度 | 85.36% | ≤80% | ≤80% | ≤75% |
| 引用召回率 | 90.82% | — | — | — |
| 报告清晰度 | 83.70% | — | — | — |
| 报告洞察力 | 78.01% | — | — | — |
| 关键信息覆盖率 | 64.67% | — | — | — |
GPT Researcher 在所有五个维度都拿了第一。尤其是引用精度 85.36% 和召回率 90.82%——它是唯一在"引用"这个维度上双双超过 85% 的工具。
但别急着庆祝。85% 的引用精度意味着每 7 条引用中仍有 1 条可能有问题。对学术写作来说,这个数字不够——你必须逐条核对。
不只是"Web 搜索",它还能读你本地的论文
GPT Researcher 支持本地文档研究。设置 export DOC_PATH=/path/to/papers 后,它会把你的 PDF、Word、PPT、Excel 纳入研究范围。
这意味着你可以用它做混合研究:同时搜最新的 web 资料和你积累的本地论文库,生成带双重来源引用的报告。
支持 100+ LLM,包括 OpenAI、Anthropic、Gemini,以及通过 Ollama 运行的本地模型。用本地模型跑的话,零 API 费用,但报告质量会下降。
快速上手
安装过程出奇简单——比大多数同类项目清爽得多:
1git clone https://github.com/assafelovic/gpt-researcher
2cd gpt-researcher
3pip install -r requirements.txt
配置 .env 文件,至少需要两个 key:
1OPENAI_API_KEY=sk-xxx
2TAVILY_API_KEY=tvly-xxx
然后:
1python main.py浏览器打开 localhost:8000,就是它的 Web 界面。也支持纯 CLI 和 Python API 调用,Docker 部署也官方支持。
如果不想装,可以直接在 Colab 上跑。
深度研究模式:自动下钻
这是它的杀手功能。普通模式下它搜一轮就写报告,Deep Research 模式会递归深入:
- 首轮搜索 → 发现新的子课题
- 对每个子课题再做搜索 → 发现更细的子课题
- 直到达到预设的深度或广度上限
可以配置 depth(深度,默认 2 层)和 breadth(每层几个分支,默认 4 个)。设 depth=3, breadth=5 的话,最多会产生 5 + 25 + 125 = 155 次子搜索——这就是为什么深度研究比普通搜索贵得多。
Deep Research 模式默认用 OpenAI 的 o3-mini 做推理——因为递归拆解和交叉验证需要较强推理能力。
竞品对比
| 工具 | 定位 | Stars | 亮点 | 短板 |
|---|---|---|---|---|
| GPT Researcher | 通用 Deep Research Agent | 27K | CMU 评测第一,三阶段管线 | 需要配置 API key |
| GPT Academic(中科院) | ChatGPT 学术优化 UI | 70K | 论文润色、翻译、一键 Arxiv | 本质是 UI 壳,不是 Agent |
| AI-Researcher(港大) | 全自动科研管线 | 较新 | 从文献调研到论文撰写全流程 | 偏重实验验证,通用性不足 |
| OpenScholar(Allen AI) | 科学文献 RAG | ~5K | 论文检索增强生成 | 只做检索,不写报告 |
| Perplexity Deep Research | 商业 Deep Research | — | 速度快,无需配置 | 闭源,免费次数有限 |
核心差异:GPT Academic 是"给你一个好用的 ChatGPT 学术界面";GPT Researcher 是"让 Agent 替你做研究"。前者帮你写得更好,后者帮你想得更深。
诚实地说:它不适合谁
不适合拿来直接写学术论文。GPT Researcher 生成的是"研究报告"——有引用、有结构、有分析,但它没有 LaTeX 模板、不会管理参考文献、不懂期刊投稿格式。它是你的研究助理,不是你的代笔。
引用幻觉仍然存在。虽然 CMU 测试引用精度 85%,但 15% 的误差率在学术场景下是致命的。每一条引用你都必须打开原文验证。不验证就交,等着被审稿人挂。
API 费用不低。一次 Deep Research(depth=2, breadth=4)大约产生 30+ 次 LLM 调用和 20+ 次搜索 API 调用,整体花费在 $0.5-$3 之间——取决于深度、广度和模型选择。用 o3-mini 比 gpt-4o-mini 贵 3-5 倍,但推理质量确实更好。
不是"一键出奇迹"。它的输出最适合作为初稿起点——你拿到报告后,还需要读原始文献、补充细节、调整论证、修正错误。期待它直接产出可投稿论文是不现实的。
它适合谁
- 研究生做文献综述,需要快速了解一个领域的现状
- 需要写行业报告、竞品分析、技术调研的从业者
- 跨领域研究者,需要快速进入一个新方向
- 日常需要做"深度信息整理"的知识工作者
一句话总结:GPT Researcher 是给研究者的"侦察兵",不是"特种兵"。它负责侦查地形、标记要点、画出草图——真正的攻坚,还是得你自己来。
参考:GPT Researcher GitHub | 官网 gptr.dev | DeepResearchGym 论文