google deep research 深夜升级,底层模型换成 gemini 2.5 pro:极限测评、效果分析、报告下载
今天凌晨,google终于把deep research的底层模型升级到最新当红的、口碑不错的gemini 2.5 pro了。以前,google deep research的底层模型过差,不值得深入测试。
所以,我搞了一个极限测试:让deep research一次性研究清楚芒格100模型,并输出一整份研究报告。
测试结果
研究大概进行了9分钟,使用了62个英文参考资料(实际访问了数百个网站),输出2万多字中文报告, 100模型实际解读13个,任务完成率13% (这不是偶然,下文详解)。
对比之下,之前openai deep research研究了36分钟,使用的材料资料少了很多,但是输出5万多字中文包很高,任务完成率100%。
用deep research深度研究“芒格100思维模型”:36分钟,24个英文信息源,5万字报告,质量碾压以前的人类内容(上)
值得阅读 5678 遍的 “芒格100模型” deep research 报告(下)| 附精校版epub和 PDF下载
一句话结论:单单从”研究芒格100模型“任务看,google deep research得分不超过30(满分100)。
具体情况可以看视频:
测试过程
prompt(和openai案例完全一致):
大航海时代,海盗中间流传着一个传说:海贼王在大海深处埋藏着它的宝藏,找到它的海盗将获得力量、荣耀与权力。互联网上也有一个传说,charlie munger 有 100 个思维模型,掌握这 100 个思维模型的人将拥有大智慧,成为真正的聪明人。
请帮我做一份研究,关于“查理芒格的 100 个思维模型”。包括这种说法的来源,100 模型的内容,以及对 100 个思维模型的每一个进行简要介绍。
介绍每个思维模型时,说明它是什么,为什么重要,举个例子,应用场景。
使用英文搜索,只采纳英文资料(因为互联网上英文资料在数量和质量上都是最好的),用中文回答。
我自己的思考
100个模型只解读了13个,这不是偶然。我做了一个测试,让openai deep research一次性研究包含300本书的书单,o3驱动的deep research产出了史上最长的报告,覆盖了300本书,最终报告6万多字(一个推友研究NBA球队,单个球队的研究报告也到了6万多字)。但是,之前gemini 2.0 flash驱动的google deep research,5千字就糊弄交差,实际完成1/3都不到。
为什么gemini 2.5 pro deep research会“糊弄”?要么是指令跟随能力不行(听不懂prompt)?要么是底层模型的推理能力不行?要么是上下文窗口限制?是否还有其他可能?
语言质量、报告结构上,这些没有硬性评价标准,每个人观点不同。我从这个案例中的观察是,google deep research有改善,但是确实和o3有差距;
context window之迷:gemini 2.5 pro有100万的上下文窗口,为什么只能产出2万字的报告?openai模型的上下文窗口是gemini的1/5,但是,产出报告的细致程度和质量为什么会更高?o1的上下文是20万,输出长度是10万;我估计o3的上下文可能是40万,输出长度可能是20万(毕竟,最终报告6万多汉字,加上中间的思维过程)。
初步个人结论
gemini 2.5 pro口碑这么好,deep research 应该是能用的(毕竟我只测试了一个极端的研究案例,后续我会从我的200多个openai deep research案例中精选出来对比测试)。
但是,“一分价钱一分货”的道理目前仍然成立。
google的2万多字报告,openai的5万多字报告,epub和docx和pdf版本,我提供了免费下载。给公众号发消息“芒格100模型报告”或“芒格报告”即可获得。