[논문 리뷰] Leveraging Professional Radiologists' Expertise to Enhance LLMs' Evaluation for Radiology Reports
논문은 방사선과 전문지식과 컨텍스트 내 지시 학습(ICIL) 및 사유 과정(CoT) 추론을 LLM에 결합해 AI 생성 radiology 보고서를 위한 상세하고 설명 가능한 평가 프레임워크를 만들고, 전통적인 지표와 벤치마크를 비교한다.
In radiology, Artificial Intelligence (AI) has significantly advanced report generation, but automatic evaluation of these AI-produced reports remains challenging. Current metrics, such as Conventional Natural Language Generation (NLG) and Clinical Efficacy (CE), often fall short in capturing the semantic intricacies of clinical contexts or overemphasize clinical details, undermining report clarity. To overcome these issues, our proposed method synergizes the expertise of professional radiologists with Large Language Models (LLMs), like GPT-3.5 and GPT-4. Utilizing In-Context Instruction Learning (ICIL) and Chain of Thought (CoT) reasoning, our approach aligns LLM evaluations with radiologist standards, enabling detailed comparisons between human and AI-generated reports. This is further enhanced by a Regression model that aggregates sentence evaluation scores. Experimental results show that our "Detailed GPT-4 (5-shot)" model achieves a 0.48 score, outperforming the METEOR metric by 0.19, while our "Regressed GPT-4" model shows even greater alignment with expert evaluations, exceeding the best existing metric by a 0.35 margin. Moreover, the robustness of our explanations has been validated through a thorough iterative strategy. We plan to publicly release annotations from radiology experts, setting a new standard for accuracy in future assessments. This underscores the potential of our approach in enhancing the quality assessment of AI-driven medical reports.
연구 동기 및 목표
- 방사선과 전문지식을 활용하여 AI가 생성한 방사선 보고서의 자동 평가를 향상시킨다.
- In-Context Instruction Learning (ICIL) 및 Chain of Thought (CoT) 추론을 대형 언어 모델(LLMs)과 통합하여 질적 및 양적 평가를 수행한다.
- 문장 수준 평가를 회귀 기반으로 집계하여 전문가 판단에 맞는 전체 보고서 점수를 산출한다.
- 설명 가능한 평가를 제공하고 향후 평가의 정확성을 높이기 위해 방사선과 전문의 주석의 공개 공개를 계획한다.
제안 방법
- ICIL 및 CoT와 함께 GPT-3.5 및 GPT-4를 사용하여 Original vs Predicted 방사선 보고서를 평가한다.
- 방사선과 의사가 지시문과 평가 템플릿을 작성하고, 이는 LLM이 문장별 점수와 설명을 생성하도록 안내한다.
- 회귀 모델은 문장 점수를 Overall Score로 집계하며, 문장 점수 비율 같은 특징(ro0, ro0.5, ro1, ro−1, rp0, rp0.5, rp1, rp−1)을 사용한다.
- 반복 검증: 생성된 설명과 정제된 보고서는 설명 품질을 검증하기 위한 또 다른 평가 루프를 거친다.
- NLG 지표(BLEU, METEOR, ROUGE-L) 및 CE 지표(CheXpert 라벨)를 비교하고 100개의 원본-예측 쌍에 대한 인간 평가를 수행한다.
- Kendall의 타우(Kendall’s Tau)와 Cohen의 카파(Cohen’s Kappa)를 사용해 인간 판단과의 일치를 다양한 GPT 구성(GPT-4 vs GPT-3.5; 1샷 vs 5샷; 간단한 지시문 vs 자세한 지시문)에서 평가한다.
실험 결과
연구 질문
- RQ1방사선과 지도 ICIL 및 CoT가 LLM이 방사선 보고서를 전문가 판단에 더 근접하게 평가하도록 기존 지표보다 더 잘 가능하게 하는가?
- RQ2회귀로 집계된 문장 점수는 개별 문장 점수나 표준 지표보다 전문가 평가와 더 강하게 상관관계가 있는가?
- RQ3설명 제공(CoT)이 LLM 평가의 인간 전문가와의 일치를 향상시키는가, 그리고 GPT-4와 GPT-3.5 간 차이는 어떠한가?
- RQ4제안된 프레임워크가 서로 다른 템플릿, 지시 상세 수준, 템플릿 수(1샷 vs 5샷)에 걸쳐 견고한가?
- RQ5방사선과 의사가 작성한 지시문과 템플릿이 AI 지원 평가의 설명가능성과 신뢰성에 어떻게 영향을 미치는가?
주요 결과
- 상세한 GPT-4(5샷) 모델은 METEOR보다 전문가 평가와의 일치도가 0.19 더 높았다.
- 회귀된 GPT-4 모델은 전문가 평가와의 일치가 더 강하게 나타났고, 기존 최고 지표를 0.35 포인트 초과했다.
- GPT-4는 조건 전반에서 일반적으로 GPT-3.5를 능가했고, 자세한 지시가 GPT-4의 성능을 향상시켰다.
- LLM이 제공한 설명은 인간 판단과의 일치를 향상시켰고, 설명이 없으면 상관관계가 크게 감소했다.
- 반복 검증 단계가 모든 지표에서 재생성된 보고서의 품질을 향상시켰다.
- 문장 수준 평가에서 5샷의 상세 GPT-4는 방사선과 Rater2/Rater3 수준에 근접한 Cohen의 Kappa를 달성하여 강력한 전문가 유사 성능을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.