Skip to main content
QUICK REVIEW

[论文解读] Multimodal Representation Learning via Maximization of Local Mutual Information

Ruizhi Liao, Daniel Moyer|arXiv (Cornell University)|Mar 7, 2021
Multimodal Machine Learning Applications参考文献 39被引用 32
一句话总结

该论文提出了一种多模态表示学习框架,通过最大化图像块与句子级文本嵌入之间的局部互信息(MI),以提升下游图像分类性能。通过训练图像和文本编码器,使局部视觉特征与对应的文本描述对齐——使用神经网络判别器进行MI估计——该方法在医学影像基准测试中实现了最先进性能,优于全局MI和监督基线方法,尤其在微调下游任务时表现更优。

ABSTRACT

We propose and demonstrate a representation learning approach by maximizing the mutual information between local features of images and text. The goal of this approach is to learn useful image representations by taking advantage of the rich information contained in the free text that describes the findings in the image. Our method trains image and text encoders by encouraging the resulting representations to exhibit high local mutual information. We make use of recent advances in mutual information estimation with neural network discriminators. We argue that the sum of local mutual information is typically a lower bound on the global mutual information. Our experimental results in the downstream image classification tasks demonstrate the advantages of using local features for image-text representation learning.

研究动机与目标

  • 通过利用免费文本放射科报告作为监督信号,改进医学影像中的图像表示学习。
  • 通过聚焦局部特征,解决全局互信息在捕捉细粒度图像-文本对齐方面的局限性。
  • 开发一种方法,使图像区域与其对应的文本描述更好地对齐,以提升下游分类性能。
  • 证明局部MI最大化相比全局MI或仅使用监督预训练,能产生更灵活且任务自适应的表示。

提出的方法

  • 提出最大化局部图像特征(例如,4×4×512的图像块)与从放射科报告中提取的句子级文本特征之间的互信息(MI)。
  • 使用神经网络判别器估计并优化MI的下界,采用MINE和CPC估计器以增强鲁棒性。
  • 通过在匹配和打乱的图像-文本对上优化对比目标,联合训练图像和文本编码器以及MI判别器。
  • 通过选择与给定句子MI最高的图像块并优化该对齐关系,实现局部MI最大化。
  • 使用5层残差网络(ResNet)进行局部MI,6层残差网络(ResNet)进行全局MI;使用临床BERT进行文本编码,多层感知机用于MI判别。
  • 在下游分类任务上微调图像编码器,结果表明其性能优于冻结或全局对齐的特征。

实验结果

研究问题

  • RQ1与全局MI或监督学习相比,最大化图像块与句子级文本描述之间的局部互信息是否能带来更优的图像表示?
  • RQ2在医学影像任务的下游分类性能方面,局部MI最大化与全局MI相比表现如何?
  • RQ3即使图像编码器被冻结,局部MI学习是否仍能提升性能,还是微调对发挥其优势至关重要?
  • RQ4局部MI带来的性能增益是否对MI估计器的选择(如MINE与CPC)具有鲁棒性?

主要发现

  • 在EdemaSeverity有序分类任务中,微调后的局部MI方法平均AUC达到0.88,显著优于次优方法(全局MI为0.85)。
  • 在Pathology9二分类基准测试中,微调后的局部MI方法平均AUC达到0.84,而全局MI为0.81,表明在多种病理类型下均具有一致性增益。
  • 即使在编码器冻结的情况下,局部MI方法在多个任务上的AUC表现仍可媲美完全监督学习,表明其具备强大的无监督特征学习能力。
  • 当图像编码器被微调时,局部MI带来的性能增益最为显著,表明局部MI能生成更具适应性和任务特异性的表示。
  • 该方法对MI估计器的选择表现出最小敏感性,MINE与CPC在各项任务中均取得相似性能。
  • 局部MI最大化由于采用低维表示和每张图像更多的训练样本,带来了更优的优化景观,提升了学习效率与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。