程序员老鬼

Pixels,专为医疗影像数据打造的完整工具链,从数据摄取到 AI 分析一站搞定。

在医疗影像一线干活的同学,谁没被 DICOM 折磨过? 一堆 .dcm 文件散在 NAS、移动硬盘、各种 zip 包里,想找一例特定病例,简直像在做考古。 更别说想把这些数据拉进 AI 流水线,工程师、医生、IT 三方来回拉扯,最后往往又回到了“手工拷贝+Excel 记账”的老路上。

最近看到 Databricks 官方在 GitHub 开源的一个方案:Pixels。 简单说,它就是给医疗影像数据准备的一整套“流水线模板”,从数据摄取、索引,到可视化、标注,再到模型训练和在线推理,全帮你串好了。 对那种还停留在“手工作坊”模式的影像平台来说,属于一眼就能看出能省很多心的那种。

Image

先说数据这一块。 Pixels 可以批量、也可以流式摄取 DICOM 文件,不管是散落的 .dcm,还是一大坨 zip 压缩包,都能自动解压、解析、索引元数据。 最后把整套 DICOM metadata 落到 Lakehouse 里,用 Delta 表管理,后面就可以直接用 SQL 查——比如“过去一年内的胸部 CT、年龄 60 岁以上、来自某个科室”,一句查询就搞定。

医疗领域最敏感的肯定还是隐私。 Pixels 这里做了一层格式保留加密,把患者的敏感信息保护起来,但又不会把字段搞得乱七八糟,业务系统照样能识别和关联。 等于是“看得懂结构,看不懂真人是谁”,对想上云、又担心合规的医院来说,心理压力会小很多。

有了结构化的元数据,接下来就是“怎么看片子”。 Pixels 直接把 OHIF 影像查看器嵌进了 Lakehouse Apps 里,登录 Databricks 的同学,权限这块就跟你平时跑任务、看表是一套体系。 医生和算法工程师可以在浏览器里看片、调窗宽窗位、翻多序列,顺手做个标注、分个割,体验跟传统 PACS 里的高级 Workstation 还挺接近的。

Image

更关键的是,这些标注和分割结果不是“飘在天上的”。 OHIF 里的操作可以一键写回数据库,变成结构化的标注数据集。 你不用再导出 JSON、拷贝 NII、手动对齐路径,整套流程天然就和你底下的 Lakehouse 打通了。 对做科研、做项目申报的团队来说,数据闭环这块舒服很多。

再往后,就是大家最关心的 AI 训练环节。 Pixels 提供了一套“一键拉起训练”的体验:在 OHIF 里选好数据和标注,点一下按钮,就会在后台起 Databricks 作业,跑 NVIDIA 的 MONAI 训练流程。 MONAI 本身就是专门为医疗影像优化的深度学习框架,各种分割、检测的模型模板都现成的,你只要换成自己的数据就能开练。

如果你们团队里既有工程师、也有临床医生,这种方式会特别友好。 医生在前端按自己的思路画分割、标病灶,工程师在后端调超参、改模型,大家盯着的是同一套 Lakehouse 数据,而不是互相发压缩包。 协作链路被压缩成“前端标注—后端训练—再回前端看效果”的闭环。

模型训完还不算完,落地上线才是关键。 Pixels 这块是直接对接 Databricks 的 Model Serving,用的是无服务器 GPU 集群,支撑实时分割推理。 简单理解就是:你在 OHIF 里打开一张医学影像,点一下调用模型,几乎实时就能在图像上刷出分割结果,医生可以直接对着结果做调整和二次判断。

从平台角度看,这套方案有点像是“给医疗影像建了一个标准化 AI 工厂”。 数据从进厂、清洗、加密,到中间的查询分析、可视化,再到后面的训练、部署,全都落在 Databricks 这一条 Lakehouse 上。 你既可以拿 Pixels 的默认流程开箱即用,也可以按自己的科室需求改装,比如多加一层质控、多接一个第三方系统。

当然,Pixels 现在还是一个开源加范式的角色,并不是一装就能直接扛起一家三甲医院所有业务的那种“成品系统”。 但对于想自己搭 AI 平台、又不想从零搬砖的团队来说,它已经把最难、最脏的那段基础设施帮你铺得差不多了。 剩下那点“适配你们医院/公司实际流程”的工作,交给内部开发团队来完成,会轻松很多。

GitHub 地址:github.com/databricks-industry-solutions/pixels

-END-

我为大家打造了一份RPA教程,完全免费:songshuhezi.com/rpa.html