医疗影像AI长期困在一病一模的路径里:一个模型只针对一种疾病,每学一种新病都要重新准备大量人工标注的片子。这种方式在单病种上效果不错,但面对真实临床中错综复杂的腹部CT,通用性就成了短板。9月18日,阿里巴巴达摩院与浙江大学医学院附属第一医院等机构联合研发的通用医疗影像AI模型DAMO RADAR登上国际顶级学术期刊《科学》,面向腹部增强CT可一次性识别146种病症,准确性首次达到影像科专家级水平,并已正式开源。
腹部增强CT是临床最复杂的影像场景之一,几十个器官挤在一起,藏着数百种可能的病变。过去的做法是给每种病单独训练一个模型,训练依赖大量医生逐张勾画的标注数据,成本高、周期长。研究团队换了一条路:采用视觉与语言联合学习的方法,让模型直接学习医学影像与对应诊断报告之间的内在关联,而不是完全依赖人工逐张标注。
难点在于CT数据信号稀疏,常规的视觉语言学习效果不佳,模型很容易看着片子却对不上报告。为此,研究团队在国际上首次提出器官级细粒度对齐策略:先把复杂的三维CT数据拆解成一个个独立的解剖单元,再让每个器官的影像与报告中相应描述精准对位,配合自适应对比建模动态调整。这样无需额外增加人工标注,就能完成可扩展、多用途且可解释的诊断训练。最终模型覆盖了包含恶性肿瘤在内的广泛腹部病症,研究团队重点评估了其中146种,涉及18个器官。
AUC是区分患者与正常人的能力指标,数值越接近1说明区分能力越强。在近4万次真实世界检查中,DAMO RADAR的平均AUC达到0.913,成为首个达到专家水平的通用医学影像AI模型。这个数字的含金量在于测试样本来自真实临床,而不是筛选过的公开数据集。
更值得关注的是泛化表现。面对训练时未覆盖的急诊场景,模型在急腹症识别上的AUC仍达到0.904,说明它学到的不只是训练集里的特定模式,而是对腹部影像的一般性理解能力。研究团队表示,这套方法不仅能识别腹部CT中的多种疾病,未来还有望拓展到其他类型的医疗影像。对一个需要覆盖18个器官、146种疾病的通用模型来说,泛化能力比训练集上的峰值表现更能决定它能否真正投入使用。
这一点对基层医疗机构尤其重要:设备与影像质量相当的情况下,诊断能力的差距主要来自经验积累,而通用模型提供的正是这种可复制的经验。
为了验证模型的临床价值,研究团队邀请了来自14家机构的26名影像科医生参与对比测试,其中包括11名资深医生和15名初级医生,医生与模型分别对300名患者的CT影像做出判断。结果显示,DAMO RADAR的平均准确率超过了26名医生中的23名。
但研究团队强调的重点并不是取代医生,而是辅助。在AI提示下,放射科医生识别疾病的敏感性提高了10%,也就是防漏诊的能力增强,诊断用时减少了30%以上,同时低年资医生的诊断水平能够达到高年资医生的水平。这组数据指向的是临床资源分配问题:腹部CT诊断难度极高,长期缺乏通用的辅助工具,而基层医院与三甲医院之间的经验差距,恰恰是患者能否获得及时准确诊断的关键变量。浙江大学医学院附属第一医院放射科主任医师肖文波评价称,该模型填补了临床通用辅助诊断工具的空白,如同智能阅片导航。
DAMO RADAR选择开源,是这次发布里容易被低估的部分。过去这类能力的受益者往往局限于研发机构自身或少数合作医院,开源意味着更多医疗机构和研究者可以验证、复现并在此基础上拓展。研发团队表示,这套方法的技术范式不局限于腹部CT,未来可迁移到多类医疗影像场景,为通用医疗AI研发提供新路径。
这次登顶刊并非孤立成果。达摩院在医疗AI方向已持续投入多年,三年间发表了5篇《自然·医学》和10多篇其他顶刊论文,成果覆盖胰腺癌、胃癌、肠癌等消化系统肿瘤筛查,以及主动脉夹层预警。此前还推出过平扫CT配合AI的主动脉急诊模型、胃癌影像筛查模型与肝癌诊断模型,其中一款新冠AI辅助诊断模型的首行代码被国家博物馆收藏。DAMO RADAR是在这些单病种能力基础上做的一次收拢,把分散的专病模型能力整合成一个通用底座。
这次发布的意义不只是一个模型多识别了多少种病,而是评价标准发生了迁移。在一病一模的阶段,衡量指标是某个病种上的敏感性与特异性,模型之间难以横向比较;当通用模型出现,判断标准变成单一模型在跨器官、跨病种上的覆盖广度与泛化稳定性,以及能否在未训练过的场景中保持可用水平。急腹症上0.904的AUC,正是这类新标准下的关键证据。
把视野放宽,AI for Science在9月呈现出一个共同趋势:从单点突破走向通用底座与闭环验证。五家跨国药企用联邦学习训练出蛋白预测模型,证明竞争企业可以在不共享原始数据的前提下共建模型;分子之心的反应性力场框架把分子模拟推进到动态反应层面;Periodic Labs用自家高通量实验室产出的湿实验数据训练出万亿参数材料分析模型。这些工作的共同点是,模型不再只是分析工具,而是嵌入了实验设计、数据生产与验证反馈的完整链条。医疗影像AI的通用化,是同一逻辑在临床侧的落地版本。