Skip to main content
QUICK REVIEW

[論文レビュー] Improving Factual Completeness and Consistency of Image-to-Text Radiology Report Generation

Yasuhide Miura, Yuhao Zhang|arXiv (Cornell University)|Oct 20, 2020
Topic Modeling参考文献 52被引用数 15
ひとこと要約

本稿では、放射線画像報告書生成における事実的完全性と一貫性を向上させるために、BERTScoreと組み合わせた2つの新規報酬——正確なエンティティ一致(Exact Entity Match)と包含的エンティティ一致(Entailing Entity Match)——を提案する。変換器ベースのモデルを強化学習で最適化することで、臨床情報抽出のF1スコアが22.1ポイント(+63.9%)向上し、ベースラインより優れた事実的正確性を示した。

ABSTRACT

Neural image-to-text radiology report generation systems offer the potential to improve radiology reporting by reducing the repetitive process of report drafting and identifying possible medical errors. However, existing report generation systems, despite achieving high performances on natural language generation metrics such as CIDEr or BLEU, still suffer from incomplete and inconsistent generations. Here we introduce two new simple rewards to encourage the generation of factually complete and consistent radiology reports: one that encourages the system to generate radiology domain entities consistent with the reference, and one that uses natural language inference to encourage these entities to be described in inferentially consistent ways. We combine these with the novel use of an existing semantic equivalence metric (BERTScore). We further propose a report generation system that optimizes these rewards via reinforcement learning. On two open radiology report datasets, our system substantially improved the F1 score of a clinical information extraction performance by +22.1 (Delta +63.9%). We further show via a human evaluation and a qualitative analysis that our system leads to generations that are more factually complete and consistent compared to the baselines.

研究の動機と目的

  • 高スコアのBLEUやCIDErにもかかわらず、依然として事実的不完全性や不一致が生じるニューラル画像対テキスト放射線画像報告書生成の問題に取り組むこと。
  • 疾患や解剖学的部位のエンティティカバレッジおよび推論的一致性の観点から、生成報告書を基準報告書に近づけることで、臨床的有用性を向上させること。
  • 分野特有で解釈可能な報酬を用いて、事実的正確性を最適化する強化学習フレームワークを構築すること。
  • ゴールスタンダードの情報抽出システムが利用できない状況においても、事実的正確性と強い相関を示す指標を同定することで、報告書品質のより良い評価を可能にすること。

提案手法

  • 生成報告書における放射線学的固有のエンティティ(例:疾患、解剖学的部位)のカバレッジを基準報告書と比較して測定するための正確なエンティティ一致報酬(fact_ENT)を提案する。
  • fact_ENTに弱教師付き自然言語推論(NLI)モデルを組み合わせ、エンティティ記述の一貫性を保証する包含的エンティティ一致報酬(fact_ENTNLI)を導入する。
  • 意味的同等性、特に否定や複雑な依存関係を含む放射線報告書の特徴を捉えるためにBERTScoreを統合する。
  • 一般向けNLIモデルを放射線学用語および臨床的推論パターンに適応させるために、弱教師付きアプローチを用いて放射線分野特化のNLIモデルを学習する。
  • NLL + BERTScore + fact_ENT + fact_ENTNLIの複合報酬を用いて、自己批判的強化学習で最適化された変換器ベースの画像対テキスト生成器を訓練する。
  • 臨床情報抽出(例:CheXbert)および人間評価を用いて、事実的完全性と一貫性を測る目的で、2つのオープンな放射線データセットでモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1標準的なNLG指標に代えて、分野特有の事実的報酬を導入することで、事実的に不完全で不一致のある報告書を改善できるか?
  • RQ2NLIベースの報酬を用いることで、放射線画像報告書生成におけるエンティティレベルのカバレッジおよび推論的一致性はどの程度向上できるか?
  • RQ3ゴールスタンダードの情報抽出システムが利用できない状況において、提案された報酬が臨床的正確性の信頼できる代理指標として機能できるか?
  • RQ4BERTScoreと事実的報酬を統合することで、生成報告書の事実的完全性および一貫性はどのように変化するか?

主な発見

  • 提案モデルは、MIMIC-CXRデータセットにおいてベースラインと比較して、臨床情報抽出性能で22.1ポイントの絶対的F1スコア向上(相対的+63.9%)を達成した。
  • ボード認定放射線科医による人間評価では、提案報酬を用いて生成された報告書が、ベースラインより事実的に完全で一貫性があることが確認された。
  • fact_ENTNLI報酬は臨床的正確性とのスピアマン順位相関係数ρ = 0.255を示し、BLEU4(ρ = 0.092)やCIDEr-D(ρ = 0.034)といった標準指標を上回った。
  • 定性的分析の結果、モデルは不張塞塞や左側胸膜炎の誤った記述を正しく生成し、事実的一貫性が向上していることが示された。
  • 改善は見られたが、時間的比較(例:「前回の検査と比較してより顕著」)や不確実性表現(例:「除外できない」)の処理には依然として困難を示しており、縦断的または確率的報告特徴のモデリングに限界があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。