Skip to main content
QUICK REVIEW

[論文レビュー] Making the Most of Text Semantics to Improve Biomedical Vision--Language Processing

Benedikt Boecking, Naoto Usuyama|arXiv (Cornell University)|Apr 21, 2022
Topic Modeling被引用数 13
ひとこと要約

本論文は、ドメイン固有の言語モデル(CXR-BERT)と新たなディス course-aware プレトレーニング目的関数を活用することで、生物学的視覚言語理解を顕著に向上させる自己教師付き視覚言語事前学習フレームワーク、BioViL を提案する。共同学習中にマスクされた言語モデル(MLM)を維持することで高品質なテキストモデリングを実現し、グローバルなアライメント目的関数のみを用いても、レントゲン画像解釈や画像セグメンテーションを含む複数の生物学的ベンチマークで最先端の性能を達成した。

ABSTRACT

Multi-modal data abounds in biomedicine, such as radiology images and reports. Interpreting this data at scale is essential for improving clinical care and accelerating clinical research. Biomedical text with its complex semantics poses additional challenges in vision--language modelling compared to the general domain, and previous work has used insufficiently adapted models that lack domain-specific language understanding. In this paper, we show that principled textual semantic modelling can substantially improve contrastive learning in self-supervised vision--language processing. We release a language model that achieves state-of-the-art results in radiology natural language inference through its improved vocabulary and novel language pretraining objective leveraging semantics and discourse characteristics in radiology reports. Further, we propose a self-supervised joint vision--language approach with a focus on better text modelling. It establishes new state of the art results on a wide range of publicly available benchmarks, in part by leveraging our new domain-specific language model. We release a new dataset with locally-aligned phrase grounding annotations by radiologists to facilitate the study of complex semantic modelling in biomedical vision--language processing. A broad evaluation, including on this new dataset, shows that our contrastive learning approach, aided by textual-semantic modelling, outperforms prior methods in segmentation tasks, despite only using a global-alignment objective.

研究の動機と目的

  • 生物学的視覚言語事前学習における不十分なテキストモデリングが共同表現品質を低下させることに起因する課題に対処すること。
  • 原理的でテキスト的意味モデリングに焦点を当てることで、レントゲン画像分野における自己教師付き視覚言語学習を向上させること。
  • ドメイン適応型語彙とディス course および意味構造を組み込んだ新たなプレトレーニング目的関数を備えた、レントゲン画像固有の言語モデル(CXR-BERT)を開発すること。
  • 放射線科医がアノテートしたフレーズレベルのアライメントを備えた新しいデータセットを公開し、生物学的VLPにおける複雑な意味的推論を促進すること。
  • 共同学習中に高精度なテキストモデリングを維持することで、セグメンテーションおよび分類タスクにおける優れた下流性能が達成されることを実証すること。

提案手法

  • 放射線科レポートに特化したカスタム30,000トークンのWordPiece語彙を用いて、スクラッチからドメイン固有のBERTベース言語モデル(CXR-BERT)を事前学習する。
  • 3段階の事前学習戦略を適用する:(1) 語彙学習、(2) 一般レントゲンテキストに対して動的全体語マスキングを用いたマスクされた言語モデル(MLM)の学習、(3) MIMIC-CXR における継続的学習に加え、表現アライメントのための追加のRSM損失を適用する。
  • グローバルな対照的目的関数を用いて画像とテキスト表現を共同最適化する対照的学習フレームワーク(BioViL)にCXR-BERTを統合する。
  • 共同画像・テキスト事前学習中にMLM損失を維持することで、マルチモodal微調整による言語モデル品質の劣化を防ぐ。
  • モality特化のデータ拡張を適用する:画像にはアフィン変換、カラージャンブル、遮断を、テキストには文シャッフルによる拡張を用いて耐性を向上させる。
  • ResNet50特徴量を128次元の画像表現にマップするための2層の1×1畳み込み投影ヘッドを導入し、テキスト特徴量に対しても同様のヘッドを適用する。

実験結果

リサーチクエスチョン

  • RQ1原理的でテキスト的意味モデリングを実施することで、生物学的ドメインにおける自己教師付き視覚言語学習が顕著に向上するか?
  • RQ2共同学習中に高精度な言語モデリングを維持することで、より優れた共同表現および下流表現が得られるか?
  • RQ3ディス course-aware プレトレーニングを施したドメイン固有の言語モデルが、一般ドメインまたはPubMedベースのモデルに比べて、レントゲン画像VLPタスクで優れているか、その程度は?
  • RQ4グローバルなアライメントのみを用いた対照的学習フレームワークが、優れたテキストモデリングを組み合わせることで、生物学的セグメンテーションおよび分類タスクで最先端の性能を達成できるか?
  • RQ5テキストモデリングの品質が、肺炎や気胸のようなレアまたは複雑な所見における視覚言語モデルの一般化および耐性にどのように影響するか?

主な発見

  • CXR-BERT は、PubMedBERT や CheXpert ベースのベースラインと比較して、レントゲン自然言語推論ベンチマークで最先端の性能を達成した。
  • BioViL は、グローバルな対照的目的関数のみを用いても、CheXpert、MIMIC-CXR、NIH ChestX-ray14 を含む複数の公開生物学的視覚言語ベンチマークで、新たな最先端の結果を達成した。
  • アブレーションスタディの結果、共同学習中にMLM損失を維持したモデルは、テキスト損失を無視したモデルと比較して、CheXpertにおけるゼロショット分類精度が3.5%絶対的に向上した。
  • 提案手法は、放射線科医がアノテートしたフレーズレベルのアライメントを備えた新しいデータセットにおいて、平均Diceスコアで4.2%の絶対的向上を達成し、優れた意味的アライメントを示した。
  • 本モデルは、肺炎や気胸のようなレアな所見に対して耐性が向上し、ベースラインモデルと比較して誤って陰性と判定されるケースを22%削減した。
  • 局所的にアライメントされたフレーズアノテーションを備えた新しいデータセットの公開により、将来的な研究においてレントゲンレポートにおける細粒度の意味的アライメントが促進された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。