Skip to main content
QUICK REVIEW

[论文解读] General Purpose Image Encoder DINOv2 for Medical Image Registration

Xinrui Song, Xuanang Xu|arXiv (Cornell University)|Feb 24, 2024
Brain Tumor Detection and ClassificationNeuroscience被引用 3
一句话总结

该论文提出DINO-Reg,一种无需训练的可变形图像配准方法,利用在自然图像上预训练的自监督视觉基础模型DINOv2——无需微调——提取丰富且具有语义意义的特征,用于医学图像配准。通过将DINOv2编码的特征与凸优化框架结合,该方法在多种医学影像模态和数据集上实现了鲁棒且可泛化的配准,性能达到最先进水平,并在OncoReg挑战赛中获得第一名。

ABSTRACT

Existing medical image registration algorithms rely on either dataset specific training or local texture-based features to align images. The former cannot be reliably implemented without large modality-specific training datasets, while the latter lacks global semantics thus could be easily trapped at local minima. In this paper, we present a training-free deformable image registration method, DINO-Reg, leveraging a general purpose image encoder DINOv2 for image feature extraction. The DINOv2 encoder was trained using the ImageNet data containing natural images. We used the pretrained DINOv2 without any finetuning. Our method feeds the DINOv2 encoded features into a discrete optimizer to find the optimal deformable registration field. We conducted a series of experiments to understand the behavior and role of such a general purpose image encoder in the application of image registration. Combined with handcrafted features, our method won the first place in the recent OncoReg Challenge. To our knowledge, this is the first application of general vision foundation models in medical image registration.

研究动机与目标

  • 解决现有医学图像配准方法依赖模态特定训练或缺乏全局语义的手工设计特征的局限性。
  • 探索利用如DINOv2这类在自然图像上预训练的通用视觉基础模型——无需微调——在医学图像配准中的可行性和有效性。
  • 开发一种无需训练的配准框架,结合DINOv2的全局语义理解能力与离散优化过程,实现鲁棒的形变场估计。
  • 在多样化的现实世界医学影像数据集上验证所提方法,并展示其在未见数据上的泛化能力。
  • 建立一种基于自监督视觉基础模型的新型医学图像配准范式,降低对大规模模态特定数据集的依赖。

提出的方法

  • 将DINOv2——一种在ImageNet上预训练的自监督视觉基础模型——作为无需任何微调的通用特征编码器,用于3D医学影像体积。
  • 通过独立编码每个轴向、冠状或矢状切片,将2D DINOv2特征应用于3D医学图像,并对缺失切片进行插值。
  • 采用低秩PCA降维方法压缩DINOv2特征,同时保留判别性信息,显著加速计算。
  • 在凸优化框架(ConvexAdam)中使用归一化互相关(NCC)作为相似性度量,以估计最优形变场。
  • 应用离散优化过程最小化移动图像与参考图像特征之间的NCC损失,确保收敛至全局最优解。
  • 在集成设置中将DINOv2特征与手工设计特征(如MIND)结合,进一步提升配准精度。

实验结果

研究问题

  • RQ1在无需微调的情况下,像DINOv2这样在自然图像上预训练的通用视觉基础模型,能否有效提取用于医学图像配准的有意义特征?
  • RQ2在可变形图像配准任务中,基于DINOv2的特征性能与传统手工设计特征(如MIND)相比如何?
  • RQ3使用2D DINOv2特征编码3D医学影像体积时,最优配置为何?包括切片间隔、编码视角和PCA秩等参数。
  • RQ4将DINOv2特征与手工设计特征结合,是否能提升在多样化数据集上的配准精度与鲁棒性?
  • RQ5基于DINOv2的无需训练配准框架是否能在真实世界医学影像挑战中实现最先进性能?

主要发现

  • DINO-Reg在OncoReg挑战赛中表现最佳,于ThoraxCBCT数据集上以3.86±0.93 mm的靶点配准误差(TRE)获得第一名。
  • 在凸优化中使用NCC作为损失函数,相比SSD显著提升了性能,TRE降低0.32 mm,Dice分数也更优。
  • 每间隔三张切片编码(gap=3)提供了稳定性能,而将间隔增至五张切片则导致性能下降,表明效率与精度之间存在最优平衡。
  • 低秩PCA将计算时间减少高达50倍,性能损失可忽略不计,使单例运行时间从超过300秒缩短至约60秒。
  • 轴向视图编码捕获了最高方差(前三个主成分占43.6%),并取得最佳Dice分数(0.733±0.14),优于冠状面和矢状面视图。
  • 将DINO-Reg与ConvexAdam或MIND特征集成可进一步提升性能,其中DINO-Reg+ConvexAdam组合实现最低TRE(3.72±0.68 mm)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。