[논문 리뷰] MRScore: Evaluating Radiology Report Generation with LLM-based Reward System
이 논문은 인간 평가와 뛰어난 일치도를 보이는 새로운 LLM 기반 보상 모델인 MRScore를 제안한다. 일곱 가지 임상 및 언어적 기준을 바탕으로 GPT-4를 활용해 인간과 유사한 평가 데이터를 합성하고, Mistral-7B 기반 보상 모델을 미세조정함으로써 MRScore는 전통적인 지표들인 BLEU, BERTScore 또는 RadCliQ보다도 방사선 검사 보고서 생성 분야에서 방사선 전문의 평가와 훨씬 더 높은 상관관계를 보였다.
In recent years, automated radiology report generation has experienced significant growth. This paper introduces MRScore, an automatic evaluation metric tailored for radiology report generation by leveraging Large Language Models (LLMs). Conventional NLG (natural language generation) metrics like BLEU are inadequate for accurately assessing the generated radiology reports, as systematically demonstrated by our observations within this paper. To address this challenge, we collaborated with radiologists to develop a framework that guides LLMs for radiology report evaluation, ensuring alignment with human analysis. Our framework includes two key components: i) utilizing GPT to generate large amounts of training data, i.e., reports with different qualities, and ii) pairing GPT-generated reports as accepted and rejected samples and training LLMs to produce MRScore as the model reward. Our experiments demonstrate MRScore's higher correlation with human judgments and superior performance in model selection compared to traditional metrics. Our code and datasets will be available on GitHub.
연구 동기 및 목표
- 방사선 검사 보고서 생성 분야에서 기존 자연어 생성(NLG) 지표들인 BLEU가 인간 방사선 전문의 평가와 빈도수 낮은 일치도를 보이는 문제를 해결하기 위해.
- 보고서 평가 모델을 위한 인간 레이블링 데이터의 높은 비용과 제한된 확장성 문제를 해결하기 위해.
- 방사선 전문의의 전문 지식을 구조화하고 해석 가능한 평가 체계로 변환하여 자동 보고서 평가를 위한 프레임워크를 개발하기 위해.
- 인간 레이블링 데이터를 광범위하게 필요로 하지 않고도 인간 수준의 평가 성능을 달성하기 위해 LLM이 생성한 합성 평가 데이터를 활용해 보상 모델을 훈련하기 위해.
- 임상 정확도, 언어적 품질, 구조적 완전성 등을 통합함으로써 자동 평가의 신뢰성과 해석 가능성 향상을 위해.
제안 방법
- 방사선 전문의의 입력을 기반으로 임상 소견, 언어적 품질, 구조, 일관성 등을 포함한 일곱 가지 평가 기준을 갖춘 프레임워크를 설계한다.
- GPT-4를 사용해 1,000개의 기준 보고서에 대해 3,000개의 합성 보고서 쌍(수락/기각)을 생성하고, 일곱 가지 기준에 따라 품질 점수를 부여한다.
- Mistral-7B-instruct 기반 백본을 사용해 쌍으로 구성된 보고서 데이터를 기반으로 보상 모델을 훈련하며, 보상 출력은 MRScore가 된다.
- 합성 데이터 기반의 지도 학습을 통해 보상 모델을 미세조정하며, 모델은 보고서 품질을 반영하는 스칼라 점수를 예측하도록 학습한다.
- 방사선 전문의 평가와의 상관관계를 측정하기 위해 켄달의 타우와 스피어만의 ρ를 사용해 모델 성능을 평가한다.
- BLEU, ROUGE, METEOR, CIDEr, BERTScore, RadGraph F1, RadCliQ 등 기준 지표들과의 성능을 비교한다.
실험 결과
연구 질문
- RQ1GPT-4는 인간 방사선 전문의 평가와 일치하는 합성 방사선 보고서 평가를 신뢰성 있게 생성할 수 있는가?
- RQ2합성 전문가 유사 평가 데이터를 기반으로 훈련된 LLM 기반 보상 모델이 기존 NLG 지표보다 인간 평가와 더 높은 상관관계를 보이는가?
- RQ3MRScore는 RadCliQ와 같은 하이브리드 지표와 비교해 인간 평가와의 상관관계와 언어적 다양성에 대한 강건성 측면에서 어떻게 다른가?
- RQ4임상 및 언어적 기준을 다차원 평가 프레임워크에 통합함으로써 모델 선택 및 보고서 품질 평가가 얼마나 향상되는가?
- RQ5합성 데이터 기반으로 훈련된 보상 모델은 특히 자원이 제한된 환경에서 인간 레이블링 데이터 기반 모델과 유사한 성능을 달성할 수 있는가?
주요 결과
- MRScore는 인간 방사선 전문의 평가와 켄달의 타우 0.250, 스피어만의 ρ 0.304를 기록했으며, BLEU(p-value 0.688) 및 ROUGE(p-value 0.429)와 같은 기존 지표보다 유의미하게 높은 상관관계를 보였다.
- 모든 테스트 지표 중에서 MRScore가 인간 평가와 가장 높은 상관관계(스피어만 계수 0.304)를 보였으며, BERTScore(0.200) 및 RadGraph F1(0.176)를 모두 초월했다.
- 백본 모델 중에서 Mistral-7B 기반 보상 모델가 가장 뛰어난 성능을 보였으며, 켄달의 타우 0.250, p-value 0.002로 통계적으로 유의미한 결과를 기록했다.
- MRScore는 인간 평가와 통계적으로 유의미한 상관관계(p-value = 0.002)를 보였지만, BLEU 및 ROUGE와 같은 기존 NLG 지표는 유의미한 상관관계가 없었으며(p > 0.05).
- GPT-4를 활용한 합성 데이터 생성에 기반한 프레임워크는 인간 레이블링 데이터가 필요 없이 대규모, 저비용의 훈련을 가능하게 하였으며, 전문가 평가와의 높은 일치도를 유지하였다.
- RadCliQ 기반 지표는 중간 정도의 상관관계(Spearman’s rho = -0.241)를 보였지만, MRScore는 더 높고 양의 상관관계를 보이며 인간 평가 경향과 더 잘 일치함을 시사했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.