Skip to main content
QUICK REVIEW

[論文レビュー] LViT: Language meets Vision Transformer in Medical Image Segmentation

Zihan Li, Yunxiang Li|arXiv (Cornell University)|Jun 29, 2022
Radiomics and Machine Learning in Medical Imaging被引用数 8
ひとこと要約

LViTは、医療画像セグメンテーションの性能を向上させるために、医療テキストアノテーションを統合するビジョン・ランゲージトランスフォーマーモデルを提案する。特に低リソースおよび半教師あり設定において顕著な性能向上を達成する。テキストを用いて疑似ラベルを生成し、指数的疑似ラベル反復(Exponential Pseudo label Iteration, EPI)機構を導入することで、完全教師ありモデルと同等の性能を、ラベルデータの25%のみで達成した。

ABSTRACT

Deep learning has been widely used in medical image segmentation and other aspects. However, the performance of existing medical image segmentation models has been limited by the challenge of obtaining sufficient high-quality labeled data due to the prohibitive data annotation cost. To alleviate this limitation, we propose a new text-augmented medical image segmentation model LViT (Language meets Vision Transformer). In our LViT model, medical text annotation is incorporated to compensate for the quality deficiency in image data. In addition, the text information can guide to generate pseudo labels of improved quality in the semi-supervised learning. We also propose an Exponential Pseudo label Iteration mechanism (EPI) to help the Pixel-Level Attention Module (PLAM) preserve local image features in semi-supervised LViT setting. In our model, LV (Language-Vision) loss is designed to supervise the training of unlabeled images using text information directly. For evaluation, we construct three multimodal medical segmentation datasets (image + text) containing X-rays and CT images. Experimental results show that our proposed LViT has superior segmentation performance in both fully-supervised and semi-supervised setting. The code and datasets are available at https://github.com/HUANGLIZI/LViT.

研究の動機と目的

  • セグメンテーションタスクにおける高品質なラベル付き医療画像データの不足という課題に対処すること。
  • 専門家が作成した臨床的テキストを統合することで、半教師あり学習における疑似ラベル品質を向上させること。
  • 画像とテキストの両方から共同で学習するマルチモーダルフレームワークを構築し、より優れたセグメンテーション性能を実現すること。
  • 電子カルテに既に存在する臨床的テキストアノテーションを活用し、追加のアノテーションコストをかけずに効果的に活用できること。
  • テキストで提供された病変部位の情報と整合性を持つ注目メカニズムを整えることで、モデルの解釈可能性を向上させること。

提案手法

  • LViTは、局所的な画像特徴を保持しつつグローバルなコンテキストを捉えるために、ピクセルレベルの注目モジュール(PLAM)を備えたハイブリッドCNN-Transformerアーキテクチャを採用する。
  • モデルパラメータを削減するため、テキスト特徴は完全なテキストエンコーダーではなく、学習可能な埋め込み層によって処理される。
  • 指数的移動平均を用いて、ラベル付きおよびラベルなしデータを統合して、段階的に精度を高める疑似ラベル反復(Exponential Pseudo label Iteration, EPI)機構を導入する。
  • テキスト埋め込みを直接用いて未ラベル画像の学習を監視する新しいLV(Language-Vision)損失を提案し、エンドツーエンドのテキスト誘導学習を可能にする。
  • テキスト入力は、腫瘍の位置など、構造化された臨床的記述(例:腫瘍の位置)として提供され、トークン化されてビジョントランスフォーマーのエンコーダーに組み込まれる。
  • 本モデルは、レントゲン画像およびCT画像と放射線科医がアノテートしたテキスト記述を組み合わせた3つのマルチモーダルデータセットで訓練された。

実験結果

リサーチクエスチョン

  • RQ1医療テキストアノテーションは、低リソース環境下でのセグメンテーション性能を向上させることができるか?
  • RQ2テキスト誘導型疑似ラベルの精錬は、医療画像セグメンテーションにおける半教師あり学習を改善できるか?
  • RQ3臨床的テキストを統合することで、病変領域における注目メカニズムの局在化が向上するか?
  • RQ4ラベルデータの25%のみで、完全教師ありモデルと同等の性能を達成できるか?
  • RQ5テキスト入力は、病変検出における注目マップとモデルの解釈可能性にどのように影響を与えるか?

主な発見

  • MosMedData+では、LViTが74.57%のDiceスコアと61.33%のmIoUを達成し、UNet、UNet++、nnUNet、TransUNetを上回った。
  • QaTa-COV19データセットでは、LViTが83.66%のDiceスコアと75.11%のmIoUを達成し、COVID-19肺領域セグメンテーションにおいて優れた性能を示した。
  • ESO-CTデータセットでは、LViTが71.53%のDiceスコアと59.94%のmIoUを達成し、異なる解剖的領域に対しても高いロバストネスを示した。
  • 訓練データのラベルを1/4に制限した状況でも、LViT-Tは完全教師ありモデルと同等の性能を示し、低データ環境下での有効性を確認した。
  • GradCAMの可視化結果から、テキストが提供された際、LViT-TWおよびLViT-Tモデルは病変領域により正確に注目しており、非標的領域での誤発火を低減した。
  • テキスト情報の導入により、注目メカニズムの分布が顕著に変化し、画像のみの特徴では検出できなかった病変領域に対しても、DownViT1層が活性化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。