[論文レビュー] MRScore: Evaluating Radiology Report Generation with LLM-based Reward System
本稿では、放射線科レポート生成のための新しいLLMベースの報酬モデル、MRScoreを提案する。このモデルは、人間の判断と優れた整合性を示し、GPT-4を用いて7つの臨床的および言語的基準に沿った合成された人間らしい評価データを生成し、Mistral-7Bに基づく報酬モデルを微調整することで、BLEU や BERTScore や RadCliQ といった従来の指標よりも顕著に高い相関を示す。
In recent years, automated radiology report generation has experienced significant growth. This paper introduces MRScore, an automatic evaluation metric tailored for radiology report generation by leveraging Large Language Models (LLMs). Conventional NLG (natural language generation) metrics like BLEU are inadequate for accurately assessing the generated radiology reports, as systematically demonstrated by our observations within this paper. To address this challenge, we collaborated with radiologists to develop a framework that guides LLMs for radiology report evaluation, ensuring alignment with human analysis. Our framework includes two key components: i) utilizing GPT to generate large amounts of training data, i.e., reports with different qualities, and ii) pairing GPT-generated reports as accepted and rejected samples and training LLMs to produce MRScore as the model reward. Our experiments demonstrate MRScore's higher correlation with human judgments and superior performance in model selection compared to traditional metrics. Our code and datasets will be available on GitHub.
研究の動機と目的
- 放射線科レポート生成における従来の自然言語生成(NLG)指標(例:BLEU)が人間の放射線科医の評価と整合性に欠ける問題に対処すること。
- レポート評価モデルのトレーニングデータとして人間がアノテートする必要がある高コストでスケーラビリティに制限のあるデータの課題を克服すること。
- 放射線科医の専門知識を構造的かつ解釈可能な評価システムとして統合するフレームワークを構築すること。
- 人間がアノテートしたラベルを多く必要としない、LLMによって生成された合成評価データを用いて報酬モデルを訓練し、人間と同等のスコアリング性能を達成すること。
- 臨床的正確性、言語的品質、構造的完全性を統合することで、自動評価の信頼性と解釈可能性を向上させること。
提案手法
- 放射線科医のフィードバックに基づき、臨床所見、言語的品質、構造、一貫性をカバーする7基準の評価フレームワークを設計する。
- GPT-4を用いて、1,000件のリファレンスレポートごとに3,000組の合成されたレポート対(受容/拒否)を生成し、各レポートに7基準にわたるスコアを付与する。
- ペアドレポートを用いてMistral-7B-instructをバックボーンとする報酬モデルを訓練し、報酬出力としてMRScoreを生成する。
- 合成データ上で教師あり学習を用いて報酬モデルを微調整し、モデルがレポート品質を反映するスカラー値を予測するように学習させる。
- KendallのtauとSpearmanのrhoを用いて、人間の放射線科医の評価との相関を評価する。
- BLEU、ROUGE、METEOR、CIDEr、BERTScore、RadGraph F1、RadCliQ といったベースライン指標とMRScoreの性能を比較する。
実験結果
リサーチクエスチョン
- RQ1GPT-4は、人間の放射線科医の判断と整合性の高い合成された放射線科レポート評価を信頼性を持って生成できるか?
- RQ2合成エキスパート風評価データを用いて訓練されたLLMベースの報酬モデルは、従来のNLG指標よりも人間の評価と高い相関を示すか?
- RQ3MRScoreは、RadCliQのようなハイブリッド指標と比較して、人間の評価との相関性および言語的変動に対するロバスト性において優れているか?
- RQ4臨床的および言語的基準を多変量評価フレームワークに統合することで、モデル選択およびレポート品質評価がどの程度向上するか?
- RQ5人間がアノテートしたデータを多く必要としない合成データで訓練された報酬モデルは、特にリソースが限られた環境下でも、人間がアノテートしたデータで訓練されたモデルと同等の性能を達成できるか?
主な発見
- MRScoreは人間の放射線科医の評価とKendallのtau 0.250、Spearmanのrho 0.304を示し、BLEU(p値 0.688) や ROUGE(p値 0.429)といった従来の指標よりも顕著に優れた相関を示した。
- MRScoreは、テストされたすべての指標の中で人間の評価との相関が最も高く、Spearman係数0.304を記録した。これはBERTScore(0.200) や RadGraph F1(0.176) を上回った。
- バックボーンモデルとしてMistral-7Bを用いた報酬モデルが最も優れた性能を示し、Kendallのtau 0.250、p値 0.002を達成した。これは統計的に有意であることを示している。
- MRScoreは人間の評価と統計的に有意な相関(p値 = 0.002)を示したが、BLEU や ROUGE といった従来のNLG指標は有意な相関を示さなかった(p > 0.05)。
- GPT-4を用いた合成データ生成に依存することで、人間がアノテートしたラベルを一切必要とせず、大規模かつ低コストなトレーニングが可能であり、専門家の判断と高い整合性を維持した。
- RadCliQベースの指標は中程度の相関(Spearmanのrho = -0.241)を示したが、MRScoreの正の相関でより強い相関が示され、人間の評価トレンドとの整合性が優れていることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。