[論文レビュー] Self-supervised Image-text Pre-training With Mixed Data In Chest X-rays
本稿では、胸部X線における連合表現学習のため、ペア化されたデータ、非ペア化されたデータ、および異なる機関からのデータを含む混合データ入力を活用する自己教師あり、トランスフォーマー基盤の画像・テキスト事前学習フレームワークUWOXを提案する。マルチスケールマスク視覚モデリングとクロス相関モジュールを導入することで、MIMIC-CXR、NIH14-CXR、OpenI-CXRデータセットにおいて分類、リtrieval、画像再生成の各タスクで最先端の性能を達成し、多様なデータソースにもかかわらず、堅牢性と一般化性能を示した。
Pre-trained models, e.g., from ImageNet, have proven to be effective in boosting the performance of many downstream applications. It is too demanding to acquire large-scale annotations to build such models for medical imaging. Meanwhile, there are numerous clinical data (in the form of images and text reports) stored in the hospital information systems. The paired image-text data from the same patient study could be utilized for the pre-training task in a weakly supervised manner. However, the integrity, accessibility, and amount of such raw data vary across different institutes, e.g., paired vs. unpaired (image-only or text-only). In this work, we introduce an image-text pre-training framework that can learn from these raw data with mixed data inputs, i.e., paired image-text data, a mixture of paired and unpaired data. The unpaired data can be sourced from one or multiple institutes (e.g., images from one institute coupled with texts from another). Specifically, we propose a transformer-based training framework for jointly learning the representation of both the image and text data. In addition to the existing masked language modeling, multi-scale masked vision modeling is introduced as a self-supervised training task for image patch regeneration. We not only demonstrate the feasibility of pre-training across mixed data inputs but also illustrate the benefits of adopting such pre-trained models in 3 chest X-ray applications, i.e., classification, retrieval, and image regeneration. Superior results are reported in comparison to prior art using MIMIC-CXR, NIH14-CXR, and OpenI-CXR datasets.
研究の動機と目的
- 病院データベースに蓄積された未利用の生の臨床的画像・テキストペアを活用することで、限られた大規模なアノテート済み医療画像データの課題に対処すること。
- ペア化されたデータ、非ペア化されたデータ、および異なる機関からのデータを含む混合データ入力を処理できる統合的事前学習フレームワークの開発。
- 自己教師あり事前学習を用いて、分類、リtrieval、画像再生成といった胸部X線アプリケーションの下流タスクにおける性能向上。
- 十分なデータ量がある場合に、マルチスケール視覚モデリングを備えたトランスフォーマー基盤アーキテクチャが、畳み込みニューラルネットワーク(CNN)ベースのモデルを上回るか同等の性能を発揮できることの実証。
提案手法
- 自己教師あり事前学習を用いて、画像とテキストの連合表現学習を実現する統合的トランスフォーマー基盤アーキテクチャを提案。
- 画像パッチの再構成を目的とした自己教師ありタスクとして、マルチスケールマスク視覚モデリングを導入し、空間的特徴の学習を向上。
- 画像とテキストの関係をモデリングするため、データが非ペア化されている場合や異なる機関からのものであっても、クロス相関モジュールを活用。
- ペアマッチング損失を用いて、ペア化済みおよび非ペア化済みの両設定において、画像とテキストの表現の整合性を強化。
- テキストのマスク言語モデリングを適応し、画像パッチのマスク再構成と組み合わせることで、連合事前学習を実現。
- 異なる機関からのデータ(例:あるソースの画像と別のソースのレポート)を含む混合データ入力に対応し、データ利用効率を最大化。
実験結果
リサーチクエスチョン
- RQ1自己教師あり画像・テキスト事前学習フレームワークは、複数の機関から得られるペア化済みおよび非ペア化済みの画像・テキストデータを含む混合データ入力から、効果的に学習できるか?
- RQ2医療画像分野において、マルチスケールマスク視覚モデリングは、単一スケールアプローチに比べて、画像表現学習をどのように向上させるか?
- RQ3データが非ペア化されている場合や異なるソースからのものであっても、提案されたクロス相関モジュールは、画像とテキスト特徴の整合性をどの程度向上させるか?
- RQ4提案されたUWOXフレームワークは、分類、リtrieval、画像再生成といった下流タスクにおいて、既存手法を上回る性能を示すか?
- RQ5十分なトレーニングデータがある場合、純粋なトランスフォーマー基盤アーキテクチャは、畳み込みニューラルネットワーク(CNN)ベースのモデルと比較して、同等または優れた性能を発揮できるか?
主な発見
- UWOXはMIMIC-CXRデータセットにおいて最先端の性能を達成し、画像リtrievalおよびテキストリtrievalの両タスクで先行手法を上回った。画像ベースのクエリではP@10が0.621、テキストベースのクエリでは0.603を記録した。
- ブロックサイズB=8のマルチスケール画像エンコーダーおよびデコーダーが、最高の画像再生成品質を達成し、平均SSIMが0.872、PSNRが356.5を記録した。
- ペアマッチング損失を適用することで、画像のみのリtrievalタスクにおける性能が顕著に向上し、AUCが0.727から0.732に上昇した。
- NIH14-CXRからの追加画像を活用するUWOX-mixupは、最高のリtrieval精度を達成し、テキストクエリではP@1が0.763、画像+テキストクエリではP@10が0.657を記録した。
- モデルは優れた一般化性能を示し、ミックスアップ状況下でNIH14-CXRにおいて最高の全体的結果(P100%+uP)を達成し、データの不均一性に対しても頑健であることを示した。
- 十分なトレーニングデータが利用可能な場合、トランスフォーマー基盤の画像モデリングアプローチは、分類および再生成タスクでCNNベースのベースラインと同等またはそれを上回る性能を発揮した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。