Skip to main content
QUICK REVIEW

[論文レビュー] PRIOR: Prototype Representation Joint Learning from Medical Images and Reports

Pujin Cheng, Lin Li|arXiv (Cornell University)|Jul 24, 2023
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

本論文は、文単位のプロトタイプメモリバンクとクロスモダリティ条件再構成を用いて、医用画像とレポートの間でグローバルおよびローカルなアライメントを同時に学習する、PRIORと呼ばれるプロトタイプ表現学習フレームワークを提案する。プロトタイプ分類と非自己回帰的生成によって微細な視覚的・言語的特徴をモデル化することで、複数のデータセットにおける5つの下流タスクで最先端の性能を達成し、100%の訓練データを用いたRSNAオブジェクト検出では22.20%のmAPを達成した。

ABSTRACT

Contrastive learning based vision-language joint pre-training has emerged as a successful representation learning strategy. In this paper, we present a prototype representation learning framework incorporating both global and local alignment between medical images and reports. In contrast to standard global multi-modality alignment methods, we employ a local alignment module for fine-grained representation. Furthermore, a cross-modality conditional reconstruction module is designed to interchange information across modalities in the training phase by reconstructing masked images and reports. For reconstructing long reports, a sentence-wise prototype memory bank is constructed, enabling the network to focus on low-level localized visual and high-level clinical linguistic features. Additionally, a non-auto-regressive generation paradigm is proposed for reconstructing non-sequential reports. Experimental results on five downstream tasks, including supervised classification, zero-shot classification, image-to-text retrieval, semantic segmentation, and object detection, show the proposed method outperforms other state-of-the-art methods across multiple datasets and under different dataset size settings. The code is available at https://github.com/QtacierP/PRIOR.

研究の動機と目的

  • 医用画像における微細な局所的特徴を捉えることに課題を抱える既存のビジョン・ランゲージ事前学習手法の限界を解消すること。
  • 構造的な臨床的レポートの意味論を活用することで、病変境界や症状記述などの低レベル特徴の学習を改善すること。
  • マスクされた画像と文のプロトタイプの条件付き再構成を通じて、効果的なクロスモダリティ情報交換を可能にすること。
  • 非自己回帰的かつ並列的デコード戦略を用いて、非順序的な医用レポートを再構成すること。
  • プロトタイプベースの表現学習が、下流の医用画像解析タスクの性能向上に寄与することを実証すること。

提案手法

  • 文単位のプロトタイプメモリバンクを構築し、文の表現をカテゴリカルなプロトタイプに離散化することで、意味的に類似した臨床的記述のクラスタリングを可能にする。
  • クロスモダリティ条件再構成モジュールを用い、画像特徴を用いてマスクされた画像を再構成し、逆にレポート特徴を用いてマスクされた文を再構成することで、両モダリティ間の条件付き相互情報量を最大化する。
  • 非自己回帰的生成パラダイムを用い、二部マッチングを用いて文のプロトタイプを並列に再構成することで、逐次的な自己回帰的生成を回避する。
  • 画像の局所的領域とレポート文との間でコントラスト型損失を適用し、局所的アライメントを強制する。空間的に隣接するネガティブサンプルを回避するための修正されたサンプリング戦略を採用する。
  • 局所的特徴のアテンションプーリングによりグローバル表現を取得し、同時にプロトタイプベースのクラスタリングによって局所的特徴を精緻化する。
  • エンド・ツー・エンドの学習スキームにおいて、グローバルアライメント、ローカルアライメント、クロスモダリティ再構成、プロトタイプメモリバンクを統合する。
Figure 1: Illustration of the proposed sentence-wise prototype memory bank. The prototype embedding can group sentences sharing similar information. Each sentence representation is updated to the nearest prototype after querying.
Figure 1: Illustration of the proposed sentence-wise prototype memory bank. The prototype embedding can group sentences sharing similar information. Each sentence representation is updated to the nearest prototype after querying.

実験結果

リサーチクエスチョン

  • RQ1プロトタイプベースの表現学習は、医用レポートおよび画像における微細で臨床的に関連する特徴のモデリングを向上させることができるか?
  • RQ2クロスモダリティ条件再構成は、セグメンテーションやオブジェクト検出のような局所的特徴を重視するタスクにおける低レベル特徴学習をどのように向上させるか?
  • RQ3非自己回帰的かつ並列的デコード戦略は、非順序的な医用レポートの再構成において、自己回帰的生成を上回る性能を示すか?
  • RQ4文単位のプロトタイプメモリバンクは、表現のクラスタリングおよび下流タスクへの一般化性能をどの程度向上させるか?
  • RQ5フレームワークの個々の構成要素(ローカルアライメント、再構成、プロトタイプメモリ)は、全体の性能にどの程度寄与しているか?

主な発見

  • 1% SIIM分類タスクにおいて、PRIORは87.27%の精度を達成し、次に優れた手法よりも2.42ポイント高い。
  • 1% SIIMセグメンテーションでは、PRIORは20.43%のDiceスコアを達成し、すべての構成要素を含むベースラインと比較して2.55ポイントの向上を示した。
  • RSNAオブジェクト検出では、100%の訓練データを用いてPRIORが22.20%のmAP(0.5:0.95)を達成し、前回の最先端手法を0.55ポイント上回った。
  • アブレーションスタディの結果、すべての構成要素(ローカルアライメント、クロスモダリティ再構成、文のプロトタイプメモリバンク)が不可欠であることが確認され、全モデルはキーツールクで最大4.5%の性能向上を示した。
  • t-SNE可視化では、PRIORが他の手法と比較してより明確に分離されたクラスタ型の表現を生成していることが示され、意味的分離性の向上を示している。
  • クロスモダリティアテンションマップは、モデルが特定のレポート文に対応する関連画像領域を正しく局所化していることを示しており、解釈可能性とアライメント品質の妥当性を裏付けている。
Figure 2: The overall framework of the proposed PRIOR. Given a pair of medical image and report, two independent encoders first encode each modality into a common embedding space. Then, the cross-modality alignment module aligns both global and local information between the two modalities. Finally,
Figure 2: The overall framework of the proposed PRIOR. Given a pair of medical image and report, two independent encoders first encode each modality into a common embedding space. Then, the cross-modality alignment module aligns both global and local information between the two modalities. Finally,

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。