[論文レビュー] Leveraging Professional Radiologists' Expertise to Enhance LLMs' Evaluation for Radiology Reports
本論文は放射線科医の専門知識をインコンテキスト指示学習とチェーン・オブ・ソート推論をLLMに統合し、AI生成放射線報告書を詳細で説明可能な評価フレームワークとして構築し、従来の指標と比較してベンチマークを行う。
In radiology, Artificial Intelligence (AI) has significantly advanced report generation, but automatic evaluation of these AI-produced reports remains challenging. Current metrics, such as Conventional Natural Language Generation (NLG) and Clinical Efficacy (CE), often fall short in capturing the semantic intricacies of clinical contexts or overemphasize clinical details, undermining report clarity. To overcome these issues, our proposed method synergizes the expertise of professional radiologists with Large Language Models (LLMs), like GPT-3.5 and GPT-4. Utilizing In-Context Instruction Learning (ICIL) and Chain of Thought (CoT) reasoning, our approach aligns LLM evaluations with radiologist standards, enabling detailed comparisons between human and AI-generated reports. This is further enhanced by a Regression model that aggregates sentence evaluation scores. Experimental results show that our "Detailed GPT-4 (5-shot)" model achieves a 0.48 score, outperforming the METEOR metric by 0.19, while our "Regressed GPT-4" model shows even greater alignment with expert evaluations, exceeding the best existing metric by a 0.35 margin. Moreover, the robustness of our explanations has been validated through a thorough iterative strategy. We plan to publicly release annotations from radiology experts, setting a new standard for accuracy in future assessments. This underscores the potential of our approach in enhancing the quality assessment of AI-driven medical reports.
研究の動機と目的
- 放射線科医の専門知識を活用してAI生成放射線報告書の自動評価を改善する。
- インコンテキスト指示学習(ICIL)とチェーン・オブ・ソート推論(CoT)を大規模言語モデル(LLMs)と統合し、定性的・定量的評価を行う。
- 文レベルの評価を回帰的に集約して全体の報告書スコアを専門家の判断と整合させる。
- 説明可能な評価を提供し、将来の評価精度向上のため放射線科医の注釈を公開予定。
提案手法
- ICILとCoTを用いてOriginalとPredictedの放射線報告書を評価するためにGPT-3.5とGPT-4を使用する。
- 放射線科医が指示と評価テンプレートを作成し、LLMsが各文のスコアと説明を作成する。
- 文スコアを回帰モデルで総合スコアに集約し、ro0, ro0.5, ro1, ro−1, rp0, rp0.5, rp1, rp−1といった特徴量を用いる。
- 生成された説明と改良報告は説明品質を検証するための別の評価ループを経る。
- NLG指標(BLEU、METEOR、ROUGE-L)とCE指標(CheXpertラベル)とを比較し、100組の原本-予測ペアについて人間による評価を行う。
- 複数のGPT設定(GPT-4対GPT-3.5;1ショット対5ショット;単純な指示と詳細な指示)でKendallのτとCohen’s Kappaを用いて人間判断との整合性を評価する。
実験結果
リサーチクエスチョン
- RQ1放射線科医-guided ICILとCoTにより、LLMsは従来指標よりも専門判断に近い放射線報告の評価を行えるか。
- RQ2回帰で集約した文スコアは、個々の文スコアや標準指標より専門家の評価との相関が強くなるか。
- RQ3説明(CoT)を提供するとLLMの評価と人間専門家の整合性は改善するか、GPT-4とGPT-3.5ではどう異なるか。
- RQ4提案フレームワークはテンプレート、指示の詳細度、テンプレート数(1-shot対5-shot)などの違いに対して頑健か。
- RQ5放射線科医が作成した指示とテンプレートは、AI支援評価の説明可能性と信頼性にどう影響するか。
主な発見
- 詳細なGPT-4(5-shot)モデルは専門家評価との整合性をMETEORより0.19高く達成した。
- 回帰したGPT-4モデルは専門家評価とより強く整合し、既存の最高指標を0.35のマージンで上回った。
- GPT-4は条件を問わず概してGPT-3.5を上回り、詳細な指示によりGPT-4の性能が向上した。
- LLMsが提供した説明は人間の判断との一致を高めた。説明なしでは相関が大幅に低下した。
- Iterative Verificationステップはすべての指標において再生成報告の品質を向上させた。
- 文レベルの評価では、5-shotの詳細GPT-4が放射線科医のRater2/Rater3レベルに近いコーエンのKappaを達成し、専門家に近い性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。