Skip to main content
QUICK REVIEW

[論文レビュー] A Comparison of Pre-trained Vision-and-Language Models for Multimodal Representation Learning across Medical Images and Reports

Yikuan Li, Hanyin Wang|arXiv (Cornell University)|Sep 3, 2020
Multimodal Machine Learning Applications参考文献 49被引用数 7
ひとこと要約

本研究では、チアックX線画像とレントゲン報告書から連携された画像・テキスト表現を学習するため、4つの事前学習済みビジョンアンドランゲージ(V+L)モデル—LXMERT、VisualBERT、UNITER、PixelBERT—を評価した。アブレーションスタディにより、テキストのみまたはランダム重みのモデルと比較して、連携埋め込みと事前学習の優位性が確認され、胸部所見分類においてCNN-RNNベースラインを上回ることを示した。

ABSTRACT

Joint image-text embedding extracted from medical images and associated contextual reports is the bedrock for most biomedical vision-and-language (V+L) tasks, including medical visual question answering, clinical image-text retrieval, clinical report auto-generation. In this study, we adopt four pre-trained V+L models: LXMERT, VisualBERT, UNIER and PixelBERT to learn multimodal representation from MIMIC-CXR radiographs and associated reports. The extrinsic evaluation on OpenI dataset shows that in comparison to the pioneering CNN-RNN model, the joint embedding learned by pre-trained V+L models demonstrate performance improvement in the thoracic findings classification task. We conduct an ablation study to analyze the contribution of certain model components and validate the advantage of joint embedding over text-only embedding. We also visualize attention maps to illustrate the attention mechanism of V+L models.

研究の動機と目的

  • 医療画像と報告書から連携された画像・テキスト表現を学習する4つの事前学習済みビジョンアンドランゲージモデルの性能を評価すること。
  • マルチラベル胸部所見分類タスクにおいて、従来のCNN-RNNベースライン(TieNet)と比較して、事前学習済みV+Lモデルの有効性を検証すること。
  • アブレーションスタディを通じて、連携された画像・テキスト埋め込みとテキストのみの埋め込みの寄与度を分析すること。
  • 生物医学分野における、事前学習とランダム重みからの学習の性能差に及ぼす影響を調査すること。
  • 注目度マップとモダリティ重要度スコアを用いて、V+Lモデルにおけるモダリティ間相互作用を可視化し理解すること。

提案手法

  • MIMIC-CXRデータセット上で、LXMERT、VisualBERT、UNITER、PixelBERTの4つの事前学習済みV+Lモデルを微調整し、連携された画像・テキスト表現学習を実施した。
  • ペアードX線画像とレントゲン報告書から13の胸部所見を予測するため、[CLS]トークンの上にマルチラベル分類ヘッドを適用した。
  • データ前処理を実施し、1件の前額ビューX線画像に限定し、ラベルを4クラスから2クラス(陽性/陰性)に再分類した。
  • アブレーションスタディとして、連携された画像・テキスト埋め込み、テキストのみの埋め込み、ランダム重みモデルを比較し、連携学習の寄与度を隔離した。
  • 最良のパフォーマンスを示したモデル(VisualBERT)の異なる層における注目度マップを可視化し、モダリティ間相互作用と注目度パターンを分析した。
  • 層レベルのモダリティ重要度(MI)スコアを計算し、視覚的およびテキスト的モダリティの相対的注目度貢献度を定量的に評価した。
Figure 1: Overview of applying V+L models to learn joint image-text embedding from CXR images and associated reports for thoracic findings identification.
Figure 1: Overview of applying V+L models to learn joint image-text embedding from CXR images and associated reports for thoracic findings identification.

実験結果

リサーチクエスチョン

  • RQ1事前学習済みビジョンアンドランゲージモデルは、胸部所見分類のための連携表現学習において、CNN-RNNベースラインと比較してどのように異なるか?
  • RQ2医療分野のV+Lタスクにおいて、連携された画像・テキスト埋め込みとテキストのみの埋め込みの相対的寄与度は何か?
  • RQ3生物医学分野において、事前学習はランダム重みからの学習に比べて顕著なパフォーマンス向上をもたらすか?
  • RQ4V+Lモデルにおける注目度機構は、異なる層において視覚的およびテキスト的モダリティの間でどのように分布するか?
  • RQ5V+Lモデルの失敗モードは何か?また、トークン化とレポートの切り詰め処理は予測にどのように影響を与えるか?

主な発見

  • 事前学習済みV+Lモデルは、OpenIデータセットにおいてCNN-RNNベースライン(TieNet)を顕著に上回り、胸部所見分類の平均F1スコアで15%の向上を示した。
  • アブレーションスタディにより、連携された画像・テキスト埋め込みが常にテキストのみの埋め込みを上回ることが確認され、マルチモodal融合の価値が示された。
  • 事前学習はランダム重みからの学習に比べて顕著なパフォーマンス向上をもたらし、大規模データセットでの事前学習の重要性が強調された。
  • VisualBERTが4つのモデルの中で最高のパフォーマンスを示し、OpenIテストセットにおける平均F1スコアは0.54であった。
  • 層レベルのモダリティ重要度(MI)スコアは、特に中間層において、テキストモダリティが視覚モダリティよりも顕著に高い注目度を示した。
  • 誤差分析から、サブワードトークン化(例:WordPiece)により、希少語「hydropneumothorax」がより一般的な語「pneumothorax」と一致するサブワードに分割され、誤検出を引き起こす可能性があることが判明した。
Figure 2: Visualization of the selected attention maps learned by the VisualBERT model.
Figure 2: Visualization of the selected attention maps learned by the VisualBERT model.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。