Skip to main content
QUICK REVIEW

[論文レビュー] Towards a clinically accessible radiology foundation model: open-access and lightweight, with automated evaluation

Juan Manuel Zambrano Chaves, Shih-Cheng Huang|arXiv (Cornell University)|Mar 12, 2024
Radiology practices and educationMedicine被引用数 3
ひとこと要約

本稿では、100万件の胸部X線画像レポートペアを用いて訓練された、7Bパラメータの軽量なマルチモーダル基盤モデル「LLaVA-Rad」を紹介する。このモデルは、放射線科分野における臨床的熟達度のギャップを埋める目的で開発された。オープンソースのビジョンおよび言語モデルを組み合わせ、モジュラーなアダプタベースのファインチューニング手法を採用することで、画像とテキストの埋め込みを効率的に統合。このアプローチにより、GPT-4V や Med-PaLM M よりも優れた性能を達成した。また、1台のV100 GPU上で高速かつプライベートな推論が可能であり、GPT-4を活用した自動評価フレームワークにより、専門家水準の評価と一致する。

ABSTRACT

The scaling laws and extraordinary performance of large foundation models motivate the development and utilization of such models in biomedicine. However, despite early promising results on some biomedical benchmarks, there are still major challenges that need to be addressed before these models can be used in real-world clinics. Frontier general-domain models such as GPT-4V still have significant performance gaps in multimodal biomedical applications. More importantly, less-acknowledged pragmatic issues, including accessibility, model cost, and tedious manual evaluation make it hard for clinicians to use state-of-the-art large models directly on private patient data. Here, we explore training open-source small multimodal models (SMMs) to bridge competency gaps for unmet clinical needs in radiology. To maximize data efficiency, we adopt a modular approach by incorporating state-of-the-art pre-trained models for image and text modalities, and focusing on training a lightweight adapter to ground each modality to the text embedding space, as exemplified by LLaVA-Med. For training, we assemble a large dataset of over 697 thousand radiology image-text pairs. For evaluation, we propose CheXprompt, a GPT-4-based metric for factuality evaluation, and demonstrate its parity with expert evaluation. For best practice, we conduct a systematic ablation study on various choices in data engineering and multimodal training. The resulting LlaVA-Rad (7B) model attains state-of-the-art results on standard radiology tasks such as report generation and cross-modal retrieval, even outperforming much larger models such as GPT-4V and Med-PaLM M (84B). The inference of LlaVA-Rad is fast and can be performed on a single V100 GPU in private settings, offering a promising state-of-the-art tool for real-world clinical applications.

研究の動機と目的

  • 放射線科AI分野における臨床的熟達度のギャップを解消するため、小規模でアクセス可能かつ効率的なマルチモーダル基盤モデルの開発を目的とする。
  • 大規模なクラウドホスティングモデルが抱えるプライバシー、コスト、レイテンシの障壁を克服し、臨床現場でプライベートかつオンプレミスに最新の放射線AIモデルを導入可能にする。
  • GPT-4を活用した信頼性の高い自動評価フレームワークを構築し、放射線レポートにおける事実の正確性について、専門放射線科医の評価と同等の水準を達成する。
  • 効率的なデータ処理とアダプタベースのファインチューニングにより、小規模でオープンソースのモデルが放射線タスクでSOTA性能を達成できることを示す。

提案手法

  • GPT-4を用いてレポートのクリーニングと構造化を実施し、8つの多様なソースから構成される1,034,660件の胸部X線画像レポートペアからなる大規模データセットを構築する。
  • オープンソースのビジョンおよび言語基盤モデルを組み合わせ、画像とテキストの埋め込みを統合するための軽量なアダプタのみをファインチューニングすることで、パラメータの更新を最小限に抑えたモジュラーなアーキテクチャを採用する。
  • 放射線レポートにおける6種類の事実的誤りを定量化する、GPT-4に基づく新規評価指標(G-Rad)を実装。臨床的に有意義な誤りと無視可能な誤りを区別する。
  • Kendall’s Tau b相関係数と対応t検定を用いて、ReXvalデータセット上でのG-Radの専門家放射線科医による誤りアノテーションとの整合性を検証する。
  • データ工学およびトレーニング設定の系統的アブレーションスタディを実施し、モデルのパフォーマンスと耐性を最適化する。
  • 全32層および32ヘッドの注意メカニズムを可視化し、テキスト生成が画像のどの領域に根拠付けられているかを定性的に分析する。

実験結果

リサーチクエスチョン

  • RQ1大規模で特許を取得したモデルに依存せずに、小規模でオープンソースのマルチモーダルモデルが、放射線レポート生成およびクロスモーダルリtrievalタスクでSOTA性能を達成できるか?
  • RQ2GPT-4を活用したLLMベースの評価システム(G-Rad)は、放射線レポートにおける臨床的に有意義な事実的誤りを検出する点で、専門放射線科医の評価と同等の性能を示せるか?
  • RQ3100万件の洗練済み画像レポートペアを用いた、軽量なアダプタベースのファインチューニングアプローチが、GPT-4V や Med-PaLM M よりも大きなモデルに比べ、臨床ベンチマークで優れた性能を示せるか?
  • RQ4モデルの注意メカニズムは、胸部X線画像のどの解剖学的領域に生成されたテキストを根拠付けているか?このプロセスが示す知見は、モデルの推論プロセスにどのような洞察をもたらすか?
  • RQ5モデルの効率性と低ハードウェア要件を踏まえ、臨床現場が自らのデータでこのモデルをローカルでファインチューニングできる範囲はどの程度か?

主な発見

  • LLaVA-Rad(7B)は、標準的な放射線ベンチマークでSOTA性能を達成し、GPT-4V や Med-PaLM M(84B)といったより大きなモデルを上回る性能を示した。
  • GPT-4-Turboに基づくG-Rad評価指標は、専門放射線科医の評価と強く相関しており、ReXvalデータセット上でのKendall’s Tau b係数は0.8を超えた。
  • MIMIC-CXRテストセットにおける臨床的に有意義な誤りおよび全誤りの数をG-Radが計測した結果、LLaVA-Med より2.5倍、GPT-4V より3倍の少ない臨床的有意義な誤りを生成した。
  • 5つの一般的な所見(不張塞過、心臓肥大、浸潤、浮腫、胸膜効果)におけるF1-CheXbertスコアは0.82を記録し、過去のSOTAモデルを上回った。
  • LLaVA-Radは8台のA100クラスタで2日間でファインチューニング可能であり、1台のV100 GPU上でも効率的な推論が可能で、臨床現場でのプライベートかつ低レイテンシなデプロイメントを実現した。
  • 定性的な注意可視化により、モデルが生成された語句を関連する画像領域に効果的に根拠付けしていることが確認され、全層および全ヘッドで一貫した注意パターンを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。