Skip to main content
QUICK REVIEW

[论文解读] Advancing human-centric AI for robust X-ray analysis through holistic self-supervised learning

Théo Moutakanni, Piotr Bojanowski|arXiv (Cornell University)|May 2, 2024
Radiomics and Machine Learning in Medical ImagingMedicine被引用 3
一句话总结

RayDINO 是一个参数量为 307M 的视觉变换器模型,通过在来自全球多个数据集的 87.3 万张胸部 X 光片上进行自监督 DINOv2 训练而成。该模型在分类、分割、报告生成和泛化能力等 21 项基准测试中均达到最先进性能,同时展现出对人口统计偏差的更强鲁棒性,并实现无需对主干网络进行任务特定微调的全面患者中心分析。

ABSTRACT

AI Foundation models are gaining traction in various applications, including medical fields like radiology. However, medical foundation models are often tested on limited tasks, leaving their generalisability and biases unexplored. We present RayDINO, a large visual encoder trained by self-supervision on 873k chest X-rays. We compare RayDINO to previous state-of-the-art models across nine radiology tasks, from classification and dense segmentation to text generation, and provide an in depth analysis of population, age and sex biases of our model. Our findings suggest that self-supervision allows patient-centric AI proving useful in clinical workflows and interpreting X-rays holistically. With RayDINO and small task-specific adapters, we reach state-of-the-art results and improve generalization to unseen populations while mitigating bias, illustrating the true promise of foundation models: versatility and robustness.

研究动机与目标

  • 开发一种用于胸部 X 光分析的基础模型,以实现超越狭窄任务特定监督的全面、以患者为中心的解读。
  • 解决当前放射科人工智能模型在泛化能力方面的局限性,包括对未见人群的泛化能力差以及与年龄、性别和种族相关的偏见。
  • 评估自监督视觉基础模型在真实临床环境中对多样化人群和成像协议的鲁棒性和公平性。
  • 证明单一冻结的视觉编码器配合轻量级任务特定适配器,可在多种放射学任务中超越专用模型的性能。
  • 通过专家放射科医生评估和全面基准测试,验证模型的临床实用性和可解释性。

提出的方法

  • 在来自美国和欧洲四个公开数据集的 873,000 张胸部 X 光片上,使用 DINOv2 自监督学习目标训练视觉变换器(ViT)编码器。
  • 利用对比自监督方法学习丰富且可泛化的表征,无需任何人工标注的标签或配对文本。
  • 仅通过少量可训练适配器,将冻结的 RayDINO 编码器直接应用于九项下游任务,包括分类、分割和报告生成。
  • 在来自七个不同国家、分布在四大洲的十一个外部数据集上评估模型的零样本泛化能力和人口统计鲁棒性。
  • 在多样化基准测试中使用标准化指标(如 AUROC、mDice、皮尔逊相关系数和 AUPRC),涵盖罕见疾病和代表性不足的人群。
  • 通过年龄、性别和人口统计学特征进行偏差分析,以评估公平性和模型泛化能力。

实验结果

研究问题

  • RQ1在大规模、多样化 X 光数据集上训练的自监督视觉基础模型,是否能在不进行任务特定主干微调的情况下,在多种放射学任务中实现最先进性能?
  • RQ2RayDINO 在来自不同国家和成像协议的外部数据集上,零样本泛化性能如何?
  • RQ3与监督基线相比,自监督预训练在多大程度上减少了人口统计偏差(如年龄、性别或种族)?
  • RQ4单一冻结编码器配合轻量级适配器,是否能提供支持多样化临床任务的全面、以患者为中心的表征?
  • RQ5当由专家放射科医生评估时,RayDINO 在可解释性和临床相关性方面表现如何?

主要发现

  • RayDINO 在涵盖分类、分割、报告生成和未见人群泛化等九项放射学任务的 21 项基准测试中均达到最先进性能。
  • 该模型在 AUROC(分类)、mDice(分割)和 AUPRC(罕见类别)方面显著优于先前最先进模型,部分基准性能提升高达 10%。
  • RayDINO 展现出对未见人群和外部数据集的优越泛化能力,在 BRAX 和 PAXRay 基准测试中 AUROC 高于以往模型。
  • 模型在年龄和性别子组中表现出更低的偏差,与监督基线相比,对少数群体的性能更加一致。
  • 专家放射科医生验证了 RayDINO 表征的可解释性,确认其具有临床相关性并能实现对 X 光影像发现的全面理解。
  • 尽管使用了冻结编码器,RayDINO 仍通过极少的任务特定适配实现了具有竞争力的性能,凸显出自监督预训练在医学影像中的多功能性和鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。