Skip to main content
QUICK REVIEW

[論文レビュー] Improving Radiology Report Generation Systems by Removing Hallucinated References to Non-existent Priors

Vignav Ramesh, Nathan Andrew Chi|arXiv (Cornell University)|Sep 27, 2022
Topic Modeling被引用数 12
ひとこと要約

本論文は、存在しない過去のレポートに関する幻覚的記述を削除することで臨床的正確性を向上させるレセプション報告生成モデルであるCXR-ReDonEを提案する。MIMIC-CXRデータセットを、GILBERTと呼ばれるBioBERTベースのトークン分類器を用いて事前処理し、過去のレポートへの言及を除去することで、著者らはクリーニングされたデータ上でCXR-RePaiRを再訓練し、BERTScoreが0.2351に達し、2.57%の絶対的向上を達成した。また、生成レポートにおける幻覚的記述も顕著に減少した。

ABSTRACT

Current deep learning models trained to generate radiology reports from chest radiographs are capable of producing clinically accurate, clear, and actionable text that can advance patient care. However, such systems all succumb to the same problem: making hallucinated references to non-existent prior reports. Such hallucinations occur because these models are trained on datasets of real-world patient reports that inherently refer to priors. To this end, we propose two methods to remove references to priors in radiology reports: (1) a GPT-3-based few-shot approach to rewrite medical reports without references to priors; and (2) a BioBERT-based token classification approach to directly remove words referring to priors. We use the aforementioned approaches to modify MIMIC-CXR, a publicly available dataset of chest X-rays and their associated free-text radiology reports; we then retrain CXR-RePaiR, a radiology report generation system, on the adapted MIMIC-CXR dataset. We find that our re-trained model--which we call CXR-ReDonE--outperforms previous report generation methods on clinical metrics, achieving an average BERTScore of 0.2351 (2.57% absolute improvement). We expect our approach to be broadly valuable in enabling current radiology report generation systems to be more directly integrated into clinical pipelines.

研究の動機と目的

  • レセプション報告生成モデルにおける、存在しない過去のレポートに関する幻覚的記述という広範な問題に対処すること。
  • 訓練データから過去のレポートへの参照を除去することで、生成レポートの事実的整合性と臨床的信頼性を向上させること。
  • 意味的および臨床的忠実度を維持したまま、スケーラブルで効率的な過去参照除去手法を開発すること。
  • 自動化された報告生成システムを実臨床ワークフローに統合しやすくすること。
  • データ前処理、特に過去参照の除去が、下流モデルの性能を顕著に向上させられることを実証すること。

提案手法

  • 著者らは、2段階のパイプライン(FilBERT+GPT-3およびGILBERT)を用いて、過去のレポート参照を除去したMIMIC-CXRデータセットのクリーニング版であるMIMIC-PROを導入する。
  • GILBERTは、微調整されたBioBERTモデルであり、トークンレベルでの分類を実行し、過去のレポートを指す語句を特定・削除する。
  • モデルは、過去のレポート参照が68.3%削除されたデータセットMIMIC-PRO上で再訓練される。この処理により、259,376件のインスタンスが82,074件に削減された。
  • CXR-ReDonEは、画像とテキストエンコーダーを用いたコントラスト学習フレームワークを用いてMIMIC-PRO上で再訓練される。このフレームワークにより、報告書とレントゲン画像の埋め込みが一致するように学習される。
  • 報告生成は、画像埋め込みとテキスト埋め込みのドット積類似度が最大となる出力を選択することで実行される。
  • 評価には、意味的メトリクスとしてBERTScore、$s_{emb}$(CheXbertによるコサイン類似度)、およびRadGraph $F_1$ を用い、事実的整合性と臨床的エンティティの重複度を評価する。

実験結果

リサーチクエスチョン

  • RQ1訓練データにおける存在しない過去のレポートに関する幻覚的記述を除去することで、レセプション報告生成モデルの事実的整合性が向上するか?
  • RQ2BioBERTベースのトークン分類モデル(GILBERT)は、GPT-3ベースの再ライティング手法と比較して、過去のレポート参照を同定・除去する上でどれほど効果的か?
  • RQ3過去参照の除去されたデータセット上でレポート生成モデルを再訓練することで、臨床的メトリクスにおける性能向上はどの程度達成されるか?
  • RQ4生成レポートに過去のレポート参照が存在しないことで、放射線科医が作成したレポートとの整合性が向上し、臨床プロセスへの統合が促進されるか?
  • RQ5アーキテクチャ的革新よりも、データ前処理戦略(特に過去参照の除去)が、報告生成品質の向上に優れていると示せるか?

主な発見

  • CXR-ReDonEは、エキスパートが編集したテストセットでBERTScore 0.2351を達成し、最高性能を示したベースラインと比較して2.57%の絶対的向上を示した。
  • k=1の場合、$s_{emb}$は0.3967に達し、最良のベースラインと比較して2.24%の向上を示した。
  • k=3の場合、CXR-ReDonEはRadGraph $F_1$ スコア0.1112を達成し、最も強力なベースラインと比較して2.68%の向上を示した。
  • データセット内の過去のレポート参照数は、MIMIC-CXRの259,376件からMIMIC-PROの82,074件に減少し、68.3%以上の削減が達成された。
  • GILBERTは過去レポート参照検出において$F_1$スコア0.84を達成し、FilBERT+GPT-3パイプライン($F_1 = 0.56$)を精度とコスト効率の両面で上回った。
  • 定性的分析により、CXR-ReDonEは、ベースラインモデルと比較してはるかに少ない幻覚的過去研究参照を含む診断的に正確なレポートを生成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。