叶小钗

王小川的最后一搏:红杉宠儿OpenEvidence 能否“拯救”百川智能?

关注公众号,回复666,获取资料

10月22日,百川号称发布最强循证增强大模型 M2 Plus:《“医生版 ChatGPT”》

评测显示,M2 Plus 的医疗幻觉率较通用大模型显著降低,相比 DeepSeek 低约 3 倍,优于美国最火医疗产品 OpenEvidence,可信度比肩资深临床医生水准。

需要特别注意的是两个关键词:OpenEvidence 与幻觉率(相较于DeepSeek)。

该模型(产品)的目标就是为降低幻觉率,而他选择的技术路径/对标产品是 OpenEvidence。

OpenEvidence 这个名词出现的频率很高,他是今年在垂直 Agent 当仁不让的明星产品,收到各种吹捧,比如在之前红杉闭门会就指出:

企业级市场中,真正先跑出来的入口未必是通用大模型,而是 Harvey(法律)、OpenEvidence(医疗)这类垂直领域智能体 OS,因为它们能听懂行业语言,理解真实需求。

所以,答案就很清晰了:百川是想将自身打造为国内的OpenEvidence对标品,所以我们来深入看看资本宠儿 OpenEvidence 的情况:

OpenEvidence 的产品定位

今年,AI领域几乎每周都有新产品发布,各种论文更是层出不穷,对于我这种需要不断论文阅读、紧跟“时事”的人是很烦的,因为经常花1-2小时读一篇论文发现毫无用处。

而医学领域也是一样的,医学文献增长迅速,顶级期刊每5年翻倍,这里问题也就出现了:传统检索工具效率低下,AI搜索倒是可以解决问题,但是模型幻觉在医疗场景风险极高。

并且如 Why Language Models Hallucinate 所述,模型天生(从设计上)就是容易产生幻觉,一旦中招,会引起巨大的风险。

比如前些日子疑似华为离职员工自曝盘古事件,我想到找一些类似案例,结果DeepSeek给了一些时间地点人物事件,一应俱全的案例,十分贴合的虚假案例!

我一个搞自媒体的尚且不能接受,更何论可能危及患者医疗信息。所以,OpenEvidence 提出以证据驱动为核心,通过对权威医学文献做实时智能检索、回答,以此避免幻觉的发生。

OpenEvidence 核心理论是来源可靠、可追溯。他只使用同行评审的医学研究及权威指南,避免直接联网抓取互联网内容,平台承诺“每个回答都有出处”,并基于可信的医学证据提供支持!

我相信这是系统(产品)的刻意设计,因为他完美诠释了当前AI知识库的构建重点,他没有去做模型多模态能力扩展(高危区,容易被取代),而是去做模型关于专业KnowHow和数据上的补足。这里可参考百川智能此图:

OpenEvidence 主要面向医疗工作者,尤其是临床一线的住院医生、门诊医生、住培/实习医生等。

这里有个问题:为什么是一线工作者居多,原因很简单主任级别首先经验丰富,其次他们有助手协助完成脏活累活。

其实国内也有类似的医疗AI产品为院内一线医生提供服务,只不过他们做得不够系统也不够精细,其中云知声貌似做得不错。

从之前披露的数据来说:OpenEvidence 目前已覆盖超过1万家医疗机构,声称每日有数十万医生使用,成为历史上增长最快的医生端平台之一。

其实从设计层面出发,个人觉得 OpenEvidence 方向是绝对正确的,而且此事壁垒极高,只不过这里有个巨大问题:数据积累成本极高,所以在这条路径走通之前,其他公司/领域是根本不敢贸然尝试的!

当前,OpenEvidence 的成功,其实变相在告诉AI各个行业,我的技术路径是对的,也是给大家做数据工程的决心。

OpenEvidence 的行业意义

如前所述,数字分身类深度AI项目要解决的是多意图、多轮知识问答,其非常依赖数据的建设,从成本结构来说,一个专业数字分身类AI项目20%的投入在研发费用,80%的费用在数据层面,所以由不得企业部慎重!

所以,各个行业投入前就一定要有标杆的成功案例,毫无疑问OpenEvidence 给出了一份满意的答卷,OpenEvidence 成立于2022年,产品于2023年发布,一直到今年才开始爆发:

  1. 2025年2月(A轮):由红杉资本领投,融资约7500万美元,公司估值超10亿美元;
  2. 2025年7月(B轮):融资2.10亿美元,估值35亿美元。当时累计融资额超过3亿美元;
  3. 2025年10月(C轮):融资约2.00亿美元,公司估值达60亿美元;

这里尤其值得一提的是,OpenEvidence 并不是突然爆发的,他们的数据是持续积累的,据我之前的研究(BCG等的相关咨询,1w/h),他们早期就从同行评审文献/官方指南构建知识库:

  1. 2024 年前已有高校图书馆将其列为学习工具;
  2. 2025 年与 NEJM/JAMA 的多年期内容合作让付费期刊全文历史库(回溯至 1990 年代)系统性纳入;

严格来说,没有这些数据的积累,也不太可能有OpenEvidence 产品高质量的回答,他的来源可靠、可追溯是有所依据的。

综上,个人认为对于AI行业来说,OpenEvidence 是开了一个好头,尤其是AI应用元年的今天,接下来我们来探讨下其技术路径:

OpenEvidence 的技术路径

简单来说,OpenEvidence 采用的是RAG技术,并采用多模型系统

系统先从专业医学数据库检索相关文献(包括PubMed文章、FDA药品标签等),然后将检索到的内容输入定制化医学LLM模型,生成回答并附带文献引用。

这种做法其实逐渐成为了生产级AI应用的基本体验要求,他可以保证回答基于已有证据,有效降低了模型“幻觉”风险。

这里特别说下模型架构,也是生产级AI应用较常规的做法,采用多模型融合策略,每个模型针对不同任务,检索、摘要、问答、图表解析等优化(擅长什么用什么)。

创始人Daniel Nadler 强调避免使用单一大模型,而是采用一个模型集群,各有专攻。这里的点是:他们也在自己训练模型,比如训练了视觉模型来解析论文中的图表和表格

OpenEvidence, whose team is largely made-up of AI scientists from PhD programs at Harvard and MIT
will use the funding to train its next generation of medical domain-specialized Large Language Models (LLMs) and continue to assemble and grow the best team of scientists working at the intersection of LLMs and medicine.

具体详情可以追溯到23年的论文:《Do We Still Need Clinical Language Models?》

实证表明小型、领域专用的临床模型在若干临床文本任务上可胜过远大于它们的通用大模型。

只不过现如今这块的信息不太多(咨询者在这块也没给太多信息),他只表示基模过于强大后,除非必要的训练已经停止,只保留最核心的小模型训练,比如:

  1. 在自建的权威文献库中找“对临床问题最相关”的条目,这里目标与我们之前微调文章类似,主要在于成本和响应率,并不完全是出于模型能力;
  2. 视觉模型相关训练,这个是为了补足模型补足,因为当前模型的强项还是在于文本,图像这块是有缺漏的,比如眼科这块用1w张图片训练下效果就很好,而之前厂商是没有那种小领域数据的(或者说ROI不高);
  3. ...

这块详情我不展开,大家可以移步至:2025 综述/评测:真实世界临床问题上,专用/带 RAG 的系统显著优于通用 LLM

至于引用链方面比较简单,只要医学知识库全面就不会有问题,而重要的难点在于如何构建医疗逻辑CoT。

这个东西实现非常复杂,讲究数据工程和AI工程的无缝配合,简单描述下来就是:OpenEvidence 的“医疗逻辑”走证据锚定型解释,非长篇自由思维。

比如临床侧逻辑是:短结论+要点+强制引用,无证据则拒答;教学侧逻辑是:解释模型显式呈因。

综上,OpenEvidence 技术上以 RAG 为骨架,用受控语料(NEJM/JAMA、PubMed、指南),并自训小模型(检索/排序/试验匹配/图表解析)把每步推理绑回证据,从而压低幻觉、可复核。

这就是其大概技术路径,而这也是各个行业数字分身可以直接参考的技术路径!

接下来,我们聊聊其具体使用场景(这里是咨询的海外医生)。

OpenEvidence 的实际使用

OpenEvidence 当前核心功能是医疗的智能问答/检索工具,大白话就是做问诊的AI机器人,这块国内 MedGPT/左医/百川 等都是做得很不错的,一般体验是:

患者输入具体病情描述或临床问题,包括诊断疑问、治疗方案比较、药物副作用、检查流程等,系统会从医学知识库中提取关键信息,生成答案并提供参考文献链接。

与传统知识库不同,AI在专业知识整合这里能力极强,赢得了医生称“口袋里的专家小组”称号,比如以下场景(各位医疗行业可以借鉴的):

  1. 查询罕见 并发症/罕见病例/疑难杂症 处理方案时,快速获得最新指南和研究结论;
  2. 紧急情况下,医生通过手机应用迅速询问药物剂量和替代方案等;

可以看出,虽然初期OpenEvidence 的使用对象是医学专业人员,但其实他可以很快被扩展到2C场景,并且并不担心Token费用问题,因为历史上他们已经做好部署,有买单方了!

OpenEvidence 的主要盈利方式来源于免费 + 广告。因其免费、专业、好用的特性,在医生圈口碑传播极快。据数据披露每月有约6.5万名新的美国医生注册;流量大了后,医疗板块的广告收入也就来了,这也成了其公司的主要收入;

据第三方机构Sacra估算:2025-06,OpenEvidence 年化营收约 5000 万美元、毛利率约 90%。

总而言之,无论从医生评价还是具体收入,OpenEvidence都展示出了不小的潜力。

至此,相信各位对 OpenEvidence 有了相当的了解,我们再回归百川智能这次发布,就很能抓住其脉络了!

百川“医生版ChatGPT”

首先,从百川官方披露文章来说,其强调的依旧是模型幻觉问题。为此,他们推出了六源循证推理范式,其逻辑与OpenEvidence非常类似,大白话就是:对医疗数据进行分层:

  1. 原始研究层:索引海量医学期刊论文 4000 余万篇,超过 PubMed 收录数量,涵盖基础与临床研究成果,是循证链条的起点;
  2. 证据综述层:整合系统评价和 Meta 分析等高等级证据,提供经过汇总的研究结论;
  3. 指南规范层:引入国际和国内权威机构发布的临床指南、专家共识和行业标准,确保回答符合最新规范;
  4. 实践知识层:包含临床病例报道、一线专家经验和诊疗技巧等实用知识,贴近医疗实践场景;
  5. 公共健康教育层:汇集权威科普和公共卫生知识,如疾病预防宣教、健康指导等内容,服务大众健康教育;
  6. 监管与真实世界层:涵盖药监部门公告、临床试验登记及大规模真实世界研究数据等信息,以反映最新的监管动态与人群研究结果;
Image

而后再完善的知识库之上搭建实现CoT的框架,这里包含了循证检索与循证推理,其核心全部是围绕如何让AI像医生一样思考做展开。最终他们在测试上取得了不错的成绩:

Image

只不过,最近一段时间以来,业内各种刷榜严重(至于刷题这种就更没有参考价值了),这些东西大家看看就好,真的好坏还要实际使用,比如下述案例:

Image

最后,无论如何对于百川这次的跟进,我个人还是非常看好的,作为曾经的医疗从业人员,也希望他们能够坚持下去,毕竟似乎他们正处于不小的麻烦...

百川的困局

从各种披露的信息来说,百川智能乃至王小川的日子可能并不好过:

Image

2023年王小川带着 “打造中国 OpenAI” 的豪言创办百川智能,两年后核心团队分崩离析。

因为之前我也是搞医疗AI的,所以对百川一直有所关注,并且当时就几乎断定他们必定维持不下去,原因无他:摊子铺的太大了!

百川智能最初是想做通用大模型的,只不过单医疗行业就OpenEvidence来说,要准备的数据就何其多,百川怎么可能连续解决各行业的生产级应用,就算他有路径也没那个资本去构建数据啊!

受挫后,王小川今年最终将赛道聚焦到医疗AI场景,从各方面来说,我认为都是不错的选择。而这次产品发布为什么他们会去对标OpenEvidence,其实估计也是看重了其估值潜力。

那么,为什么医疗AI做好了会是一场翻身仗呢?我认为答案依旧在于AI时代的流量重塑,只要将医疗入口站住,就算最简单的广告业务都非常惊人,毕竟百度搜健康问题已经逐渐没有市场了,那么医疗广告这个大蛋糕应该谁来吃?

结语

从这次发布来说,我们看到了王小川在医疗AI板块的决心,通过对OpenEvidence的详细了解,我们也认为这是一条正确的道路。

只不过,OpenEvidence就一定是一条康庄大道吗?那可能也未必,因为就算是他在实际应用中也会有不低的错误率,现阶段是9%,这个数字在持续降低。

在医疗领域,这意味着每100次诊断就有9次可能出错,这种风险是医疗行业绝对无法承受的(事实上真人也很高...)。

而所有数字分身类AI项目都有个特点,他具有强烈的非对称性,你花10万就能做个60分的产品,你花100万才能让他达到90分,而要从90提升到95可能得1000万!

以OpenEvidence“津津乐道”的典型错误为例:OpenEvidence 在ME/CFS(慢性疲劳综合征)治疗建议中,仍然推荐已被证明有害的“分级运动疗法”,而这些治疗方案实际上基于13年前的过时指南。

该案例首先说明了 OpenEvidence 的可观测性,他当然可以对其进行优化,但想要持续保持正确率在一个数字之上,那就是长时间的数据工程维护,得有这个觉悟才行!

而百川智能在技术路径上选择追随OpenEvidence,就必须正视这些前车之鉴。其引以为傲的“六源循证推理范式”和庞大的医学知识库,如果缺乏持续更新的机制和严格的质量控制,必定会重蹈覆辙。

医疗AI的竞赛是一场马拉松,而非百米冲刺。王小川和他的百川智能能否在这场长跑中笑到最后,不仅取决于技术实力,更取决于对医疗本质的理解和对质量控制的坚守。

呵呵,最终AI产品居然回归了文化价值观,可真是妙啊...

点击上方卡片关注叶小钗公众号,查看下方二维码,添加我个人微信:

Image