Skip to main content
QUICK REVIEW

[論文レビュー] Controllable Chest X-Ray Report Generation from Longitudinal Representations

Francesco Dalla Serra, Chaoyang Wang|arXiv (Cornell University)|Oct 9, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

本論文は、前回と今回のスキャンからの視覚的表現を統合して連続的表現を生成し、文構造ドロップアウトを用いて言語モデルを訓練することで、指定された解剖学的領域のみを対象とする制御可能で縦断的胸部X線レポート生成のための新規フレームワークを提案する。この手法はMIMIC-CXRデータセットで最先端の性能を達成し、正確で解釈可能で臨床的に有用な自動レポート作成を、報告対象の解剖学的領域を完全に制御可能な形で実現する。

ABSTRACT

Radiology reports are detailed text descriptions of the content of medical scans. Each report describes the presence/absence and location of relevant clinical findings, commonly including comparison with prior exams of the same patient to describe how they evolved. Radiology reporting is a time-consuming process, and scan results are often subject to delays. One strategy to speed up reporting is to integrate automated reporting systems, however clinical deployment requires high accuracy and interpretability. Previous approaches to automated radiology reporting generally do not provide the prior study as input, precluding comparison which is required for clinical accuracy in some types of scans, and offer only unreliable methods of interpretability. Therefore, leveraging an existing visual input format of anatomical tokens, we introduce two novel aspects: (1) longitudinal representation learning -- we input the prior scan as an additional input, proposing a method to align, concatenate and fuse the current and prior visual information into a joint longitudinal representation which can be provided to the multimodal report generation model; (2) sentence-anatomy dropout -- a training strategy for controllability in which the report generator model is trained to predict only sentences from the original report which correspond to the subset of anatomical regions given as input. We show through in-depth experiments on the MIMIC-CXR dataset how the proposed approach achieves state-of-the-art results while enabling anatomy-wise controllable report generation.

研究の動機と目的

  • 時間的制約のある臨床環境における自動的で正確かつ解釈可能な放射線学的レポート作成のニーズに対応すること。
  • 縦断的視覚表現をレポート生成に組み込むことで、現在と過去のCXRsの比較を可能にすること。
  • ユーザーが指定した解剖学的領域のみを対象とするレポートを生成するようにジェネレータを訓練することで、モデルの解釈可能性を向上させること。
  • 制御された解剖学的焦点を有することで、部分的レポート生成の臨床的有用性を高めること。
  • 完全および部分的レポート生成において最先端の性能を達成するとともに、臨床的所見に高い忠実性を維持すること。

提案手法

  • モデルは、現在および過去のCXRsからの解剖学的領域表現を抽出するためにFaster R-CNNを用いる。
  • 空間的および意味的対応関係を用いて、過去と現在のスキャン間の対応する解剖学的領域を一致させる。
  • 一致させた表現は連結され、学習可能なプロジェクションモジュールを介して共同の縦断的表現に投影される。
  • 共同表現は臨床的所見フィールドと組み合わされ、マルチモーダル言語モデルに供給され、レポート生成が行われる。
  • 文構造ドロップアウトと呼ばれる新しいトレーニング戦略を採用し、トレーニング中に解剖学的領域のサブセットをランダムにマスクすることで、モデルが表示された領域にのみ関連する文を生成するように強制する。
  • エンドツーエンドのモデルは、解剖学的に正確で、縦断的スキャンデータと文脈的に整合性のあるレポートを生成するように訓練される。

実験結果

リサーチクエスチョン

  • RQ1過去および現在のCXRsからの縦断的表現は、自動レポート生成の正確性および臨床的関連性を向上させることができるか?
  • RQ2文構造ドロップアウトは、指定された解剖学的領域に対応する文のみを生成するように言語モデルを効果的に訓練でき、制御性および解釈可能性を向上させることができるか?
  • RQ3本手法は、完全レポート、部分レポート、フォローアップレポートの生成において、先行手法と比較してどのように異なるか?
  • RQ4モデルの性能が、過去スキャン情報の有無および制御された解剖学的入力の有無にどの程度依存するか?
  • RQ5本モデルは、初期検査とフォローアップ検査の両方のレポートタイプに一般化可能で、一貫した性能を示すか?

主な発見

  • 提案手法はMIMIC-CXRデータセットで最先端の結果を達成し、両方のスキャンと文構造ドロップアウトを用いた完全レポート生成ではF1スコア0.589、フォローアップスキャンでは0.599を記録した。
  • 部分的レポート生成において、本手法はベースラインを著しく上回り、両方のスキャンと文構造ドロップアウトを用いた場合のF1スコアは0.683に達したのに対し、それらなしでは0.303にとどまった。
  • 生成されたレポートの長さ分布は、正解データとよく一致しており、ベースライン手法よりも自然なレポート構造に整合していることが示された。
  • アブレーションスタディの結果、特にフォローアップおよび部分的レポート設定において、縦断的表現学習と文構造ドロップアウトの両方が最適なパフォーマンスを達成するために不可欠であることが確認された。
  • 定性的な結果から、本手法を用いることで、特に部分的レポート生成時における欠落した解剖学的領域に関する幻覚が著しく減少していることが示された。
  • F1、精度、再現率の臨床的効率指標において、すべての評価設定で本手法は改善されたパフォーマンスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。