国内首个通过主任医师评测的大模型来了!免费用,技术秘籍公开
编辑 | 漠影
国内首个通过主任医师评测的大模型,已在夸克AI搜索上线。 智东西7月23日报道,今日,夸克宣布夸克健康大模型成功通过 中国12门核心学科的主任医师笔试评测 ,创 国内首例 ,展现出垂类大模型在医学领域的应用潜力。 12门核心学科分别是: 普通内科学、普通外科学、妇产科学、儿科学、皮肤与性病、肿瘤内科学、耳鼻咽喉学、麻醉学、口腔医学、眼科学、精神病学 。 在垂类模型与通用模型对比中,夸克健康大模型在初级、中级、副高、高级医疗场景中的答题正确率均超过新版DeepSeek-R1和o3-mini,并呈现出 难度越高、领先优势越明显 的性能曲线,展现出在复杂医学推理任务中的突破。
- 知识性强,用高质量数据继续训练底座大模型;
- 正确性对齐技术,把握住错误边界;
- 引入慢思考能力,基于高质量推理训练数据,通过强化学习构建推理大模型,驱动模型在面对复杂医疗问题时,能够分阶段、层层深入地推导出最终答案,提升在案例分析题等上的效果。
- 事前,通过底层算法和数据工作预防,产品满意度准确率达标后才会上线;
- 事中,模型对敏感或不确定问题拒答,产品设计兜底话术、增加溯源引用,采取机器抽查、人工抽查等策略,并对用户问题分类界定、分层处理;
- 事后,根据用户反馈,反复迭代改进模型。
01 . 基于通义千问,训练临床思维, 构建慢思考能力 夸克健康大模型通过真实医生标注、“问—思—答”整组数据驱动强化学习,不仅掌握医学知识,而且医学思维的路径选择、证据整合与多解平衡能力。 其核心突破之一,是构建出“ 慢思考能力 ”,打造多阶段慢思考推理系统,从表象判断到深度病因分析,学会医学临床诊疗思维。 这一能力融合了链式推理与多阶段临床演绎路径建模,驱动模型在面对复杂医疗问题时分阶层层推导,先推病,再解题,从病史分析、初步诊断、鉴别诊断、结合选项分析到总结得出答案。 而构建慢思考能力的前提,是拥有高质量推理训练数据。 为此,夸克构建了“ 双数据产线 + 双奖励机制 ”的工程体系。 训练数据上 ,将医学数据划分为“ 可验证 ”和“ 不可验证 ”两类,分别对应诊断类任务和健康建议类任务。
02 . 4大类数据建设和评估, 三招降幻觉+提高准确率 优质数据建设、正确性对齐及循证技术、医疗慢思考推理能力,缺一不可。 在构建大规模高质量医疗领域数据及语料上,夸克对4大类数据(资料库、病历、知识库、合成数据)进行建设和评估。
03 . 多类诊疗场景准确率与人类 医生相当, 主任医师现身给夸克“批卷” 从诊疗效果来看,在门诊常见病场景下,夸克健康大模型诊断top1准确率达到90.78%,与人类医生书写的病历准确率水平相当。在疑难病例上,模型top1准确率达到85.51%;单从诊断任务能力上近似可看成三级医院全科主任级别能力,足以作为大多数医生好用的助手。
04 . 中国超50%医学生都在用夸克 凭借在医学领域的专业性,夸克AI搜索吸引了一大批医学生和医生群体。 据夸克健康运营负责人赵存忠分享,夸克健康产品主要面向C端,围绕两类场景,一是基于搜索场景的权威健康顾问,帮普通人解决日常健康问题;二是基于医护人员的专业成长助手,帮医学生解决涉及临床诊疗、学习、资料类、考试专业需求的专业问题。
05 . 晒夸克健康搜索“全家福”, 做有温度的AI健康顾问 夸克的健康搜索内容体系,包括夸克健康百科、夸克健康问答等产品。 夸克健康百科 包含医典百科、就医指南; 夸克健康问答 包括通用问答、AIGC问答、SGS问答、深度搜索、健康助手自诊、学术搜索、包含专业资料的循证体系及知识图谱等,为用户提供权威、实用、精准的内容搜索。 夸克健康医疗搜索产品的演进,从传统生产(外发人工生产)到AIGC(模型批量生产)再到SGS(模型即时生成),用户搜索字数表达明显增加,逐渐能精准满足复杂长尾问答需求,给出明确结论。 其算法团队与医疗团队共同搭建循证体系,包含千亿级图谱病历、教材指南、文献论文、试题词典,提供专业检索。 深度搜索、深度思考能力则提高了对问题理解的精准度,使模型对于问题的回复的思考路径拆解更合理、解答的逻辑性更好,居家缓解、就医推荐的实用性更强,与医院角色形成互补。 夸克健康助手 开发基于医学临床思维的健康自诊,可以为用户提供全面的自我判断和就医推荐,提供症状自查、报告解读、在线问诊、AI自测、健康计算等功能。 该工具构建了基于医学知识系统的对话反问功能,可以在对话中收集足够的用户病症信息,给出推理分析,并给出实用的居家建议,判断病情需要就医,给出与科室推荐、检查建议,提供导医问诊服务。 夸克健康大模型还能作为健康生活科普助手,生成满足饮食、健康、运动的科普内容及优质笔记,为用户提供精准生活指导。 夸克健康利用 AI相机 功能为用户识热量、配料表分析、皮肤自诊等,提供健康饮食辅助决策及小病自查自管。比如拍张照,问AI这款零食健不健康、这个舌苔是否正常等。 除了准确率高,夸克健康还注重做有温度的AI健康顾问,按照真实医生诊疗路径分阶段、分专科训练诊断能力,在提供精准推理诊断的同时,以共情化满足用户的心理感受。 其 健康agent 是一个全科智能协同中枢,定位全科健康管家,有两大核心能力: 一是统一管理,全科健康管家统一管理信息和输入输出,用户健康问题需求由全科agent调度, 二是分发协同,所有用户请求经过全科agent初步处理,根据干预措施调用其他子agent,输出最终行动方案。
06 . 结语:健康大模型L4级基本到来, 将惠及精准医疗科普 在沟通会上,徐健总结了当前健康大模型能力水位:微软、OpenAI、讯飞等AI公司的模型或AI产品,在指定场景已做到与医生水平相当;在学术界,近1年Nature系列发了21篇医学大模型论文;在行业界,信通院发布《基于大模型的患者医疗服务应用场景及能力分级框架(2025年)》,提供了应用场景医疗服务能力的清晰分级。 L1级是信息辅助,L2级是单任务智能辅助,L3级是多任务智能辅助,L4级是高级协同决策辅助,最高等级L5智慧协同创新辅助能发现一些医生在诊疗过程中想不到的创新做法。 参考这个分级,今天,能与医生高级协同决策辅助的copilot助手(L4级别)基本到来,也将更好地帮助普通用户在健康问题上减少医患信息差。 夸克健康大模型及产品矩阵,正通过引入更强的推理能力,突破技术瓶颈,帮助医生节约时间、放大专业价值,并助力缓解医疗资源短缺问题,实现更加精准的医疗科普。
(本文系网易新闻•网易号特色内容激励计划签约账号【智东西】原创内容,未经账号授权,禁止随意转载。)