基础模型成为医疗科技新趋势,但究竟何为“基础模型”?
过去一年,GE医疗、飞利浦等企业相继布局MRI基础模型,FDA亦开始探索相关标识。然而,专家指出基础模型定义模糊,现有工具是否真正惠及放射科医生与患者尚难评估。

编者按:本文是医疗科技行业基础模型应用两篇系列报道的第一篇。第二篇将于周二发布。
越来越多的医疗设备公司开始推广“基础模型”——一种可适应多种任务的人工智能技术。然而,该技术在医疗科技行业中的应用仍存在诸多疑问。
过去一年中,GE医疗宣传了其MRI研究基础模型,飞利浦宣布计划与英伟达合作构建MRI基础模型,去年北美放射学会年会上多篇摘要聚焦于如何评估和改进基础模型。美国食品药品监督管理局(FDA)亦更新了其AI医疗器械数据库,表明正在探索识别和标记包含基础模型的设备的方法。
然而,专家表示,基础模型的定义尚不明确,且难以判断当前可用的工具是否真正帮助了放射科医生和患者。
什么是基础模型?
斯坦福大学放射学系博士后学者Magdalini Paschali指出,基础模型具备几个关键特征:它们在大规模数据集上训练,且多数数据为未标注数据;能够处理多种数据类型,如图像、文本、病史和基因组学;最后,它们能应对多种任务,例如模型可检测训练中未曾见过的疾病。

Paschali今年早些时候在RSNA的《Radiology》期刊上发表了一篇论文,试图更清晰地定义该技术。
斯坦福大学放射学与生物医学数据科学助理教授Akshay Chaudhari表示,在实践中,“一切都可以被定义为基础模型”。
Chaudhari称,“基础模型”一词于2021年首次在斯坦福大学提出。在医疗领域,最早的版本之一是2022年底谷歌推出的Med-PaLM,这是一个用于回答医学问题的大型语言模型。
Chaudhari表示,基础模型在2023年的RSNA上开始变得更加突出。
放射学中使用的传统深度学习模型(如用于检测肺炎的模型)专注于特定健康状况,并依赖标注数据。例如,放射科医生会浏览图像,圈出肺炎实例,或在文本报告中标记,Radiology Partners的临床人工智能副首席医疗官Nina Kottler如此解释。
Chaudhari指出,基础模型在数百万张图像上训练,而非数千张,要求标注数据根本不现实。
基础模型更准确吗?
一些医疗设备开发商声称基础模型比窄AI模型更准确。例如,为放射科提供分诊软件的Aidoc表示,基础模型能够更快开发出更准确的AI工具。
专家表示,设备的准确性取决于其构建方式。斯坦福大学的Paschali称,基础模型若“开箱即用”,未经任何专门化或额外训练,其表现可能不如特定AI工具,但一旦看到一些示例和上下文后,它可能表现更好。
“我们所能做的最好的事情是查看FDA许可文件中的摘要声明,至少在市场上,我们尚未真正看到这些基础模型的益处。”

Akshay Chaudhari
斯坦福大学放射学与生物医学数据科学助理教授
Kottler表示,由于基础模型在大量数据上训练,它们在发现罕见事件(如脑动脉瘤)方面可能表现更佳。
“当只有少数人患有某种疾病时,找到它就像大海捞针,”Kottler说,“你需要一个非常准确的模型才能做到这一点。”

基础模型另一个优势是能更快开发其他AI模型。Kottler称,构建传统窄AI模型可能需要六个月来清理数据、标注数据和训练,而基础模型的不同迭代可在数周内完成。
然而,在实践中,很难知道这些优势是否已转化为对患者或其护理团队的实际益处。斯坦福大学的Chaudhari表示,对于已通过FDA审批的基础模型,几乎没有公开信息支持公司的声明。
“我们所能做的最好的事情是查看FDA许可文件中的摘要声明,”他说,“至少在市场上,我们尚未真正看到这些基础模型的益处。”
评估基础模型
目前,FDA已授权的基础模型旨在解决特定任务,例如Aidoc的肋骨骨折分诊工具,该工具基于公司的基础模型构建。Aidoc使用旧版肋骨骨折分诊工具作为前代设备,获得了其模型的510(k)许可。510(k)流程要求制造商证明其设备与可在美国销售的前代设备具有实质等同性。
Chaudhari表示,对于整合语言和图像或视频的更广泛模型,目前尚无指导方针。
一些医院已提出评估AI模型的系统,但这些系统并不完美。例如,医院会确定需求,如识别X光图像中肺炎的模型或起草X光报告的模型。
“然后他们会从自己的站点收集1000张已知标签的图像,并举办一场竞赛,看哪个供应商在该数据集上表现最佳,”Chaudhari说,“这很粗糙,但这确实是目前最好的方法,因为这是评估本地性能是否真正适合特定任务的唯一途径。”

对于拥有数据科学团队的大型学术医疗中心,这可能可行,但“许多医院只会部署模型,然后从中获得质量可疑的数据,”Chaudhari补充道。
Paschali表示,要测试基础模型的准确性,首先必须根据模型声称的功能定义指标和任务。医院还应测试模型在不同患者亚组和不同扫描仪类型中的表现。最后,医院应对模型进行“压力测试”,以识别可能出现的潜在问题,例如针对非常罕见的疾病。
“这就是为什么与放射科医生密切合作非常重要,因为他们能帮助我们设计全面的压力测试,”Paschali说,“因为他们见过太多病例,知道哪些任务即使对他们来说也很困难。”
人们希望,基础模型在涵盖不同州、不同类型医院和成像设备的更大数据集上训练后,部署前所需的评估可能会更少。
“我认为我们尚未达到那个阶段,至少世界上没有证据,”Chaudhari说,“但这正是这些基础模型可能带来的诱惑。”
另一个目标是解放放射科医生的时间,以应对美国持续的放射科医生短缺和不断增长的图像数量。
“如果我们要求他们验证输出、检查一切,”Chaudhari说,“那真的实现了这些模型的承诺吗?”