[논문 리뷰] Improving Radiology Report Generation Systems by Removing Hallucinated References to Non-existent Priors
이 논문은 존재하지 않는 이전 보고서에 대한 환상적인 참조를 제거함으로써 임상 정확도를 향상시키는 CXR-ReDonE를 제안한다. MIMIC-CXR 데이터셋을 GILBERT라는 BioBERT 기반 토큰 분류기로 사전 처리하여 이전 참조를 제거한 후, 저자들은 청소된 데이터로 CXR-RePaiR를 재학습하여 BERTScore에서 2.57%의 절대적 향상(0.2351)을 달성하고 생성 보고서의 환상적 참조를 크게 감소시켰다.
Current deep learning models trained to generate radiology reports from chest radiographs are capable of producing clinically accurate, clear, and actionable text that can advance patient care. However, such systems all succumb to the same problem: making hallucinated references to non-existent prior reports. Such hallucinations occur because these models are trained on datasets of real-world patient reports that inherently refer to priors. To this end, we propose two methods to remove references to priors in radiology reports: (1) a GPT-3-based few-shot approach to rewrite medical reports without references to priors; and (2) a BioBERT-based token classification approach to directly remove words referring to priors. We use the aforementioned approaches to modify MIMIC-CXR, a publicly available dataset of chest X-rays and their associated free-text radiology reports; we then retrain CXR-RePaiR, a radiology report generation system, on the adapted MIMIC-CXR dataset. We find that our re-trained model--which we call CXR-ReDonE--outperforms previous report generation methods on clinical metrics, achieving an average BERTScore of 0.2351 (2.57% absolute improvement). We expect our approach to be broadly valuable in enabling current radiology report generation systems to be more directly integrated into clinical pipelines.
연구 동기 및 목표
- 존재하지 않는 이전 보고서에 대한 환상적인 참조 문제를 해결하기 위해.
- 학습 데이터에서 이전 참조를 제거함으로써 생성 보고서의 사실적 일관성과 임상 신뢰성을 향상시키기 위해.
- 의미적 및 임상 적합성을 유지하면서도 확장성 있고 효율적인 이전 참조 제거 방법을 개발하기 위해.
- 자동 보고서 생성 시스템을 실제 임상 워크플로우에 더 잘 통합하기 위해.
- 데이터 사전 처리—특히 이전 참조 제거—가 후행 모델 성능을 크게 향상시킬 수 있음을 입증하기 위해.
제안 방법
- 저자들은 두 단계의 파이프라인인 FilBERT+GPT-3와 GILBERT를 사용하여 이전 참조가 제거된 MIMIC-CXR 데이터셋의 청소된 버전인 MIMIC-PRO를 도입한다.
- GILBERT는 이전 보고서를 참조하는 단어를 식별하고 제거하기 위해 토큰 수준 분류를 수행하는 최적화된 BioBERT 모델이다.
- 모델은 68.3%의 이전 참조가 제거된 MIMIC-PRO 데이터셋에서 훈련되며, 이는 259,376건의 인스턴스에서 82,074건으로 감소한 것이다.
- CXR-ReDonE는 이미지 및 텍스트 인코더를 사용하는 대비 학습 프레임워크를 통해 MIMIC-PRO에서 재학습된다. 이는 보고서 및 방사선 영상 임베딩 간의 정렬을 위해 사용된다.
- 보고서 생성은 이미지와 텍스트 임베딩 간의 최고의 도트 곱 유사도를 가진 출력을 선택함으로써 수행된다.
- 평가에는 의미적 메트릭스인 BERTScore, $s_{emb}$ (CheXbert를 통한 코사인 유사도), 그리고 RadGraph $F_1$를 사용하여 사실적 일관성과 임상 엔티티의 겹침을 평가한다.
실험 결과
연구 질문
- RQ1학습 데이터에서 존재하지 않는 이전 보고서에 대한 환상적인 참조를 제거하면 병리학적 보고서 생성 모델의 사실적 일관성이 향상되는가?
- RQ2BioBERT 기반 토큰 분류 모델(GILBERT)이 GPT-3 기반 재작성 접근법보다 이전 참조를 식별하고 제거하는 데 얼마나 효과적인가?
- RQ3이전 참조가 제거된 데이터셋에서 보고서 생성 모델을 재학습하면 임상 메트릭스에서 성능 향상이 얼마나 이루어지는가?
- RQ4생성 보고서에서 이전 참조가 없는 것이 병리학자가 작성한 보고서와 더 잘 일치하고 임상 파이프라인에 더 잘 통합되는가?
- RQ5아키텍처적 혁신보다 데이터 사전 처리 전략이 보고서 생성 품질 향상에 더 효과적인가?
주요 결과
- CXR-ReDonE는 전문가가 편집한 테스트 세트에서 BERTScore 0.2351을 기록하여 가장 높은 성능을 보인 베이스라인 대비 2.57% 절대적 향상을 달성했다.
- k=1일 때 $s_{emb}$는 0.3967로, 가장 좋은 베이스라인 대비 2.24% 향상되었다.
- k=3일 때 CXR-ReDonE는 RadGraph $F_1$ 점수 0.1112를 기록하여 가장 강력한 베이스라인 대비 2.68% 향상되었다.
- MIMIC-CXR에서의 이전 참조 수는 259,376건에서 MIMIC-PRO에서는 82,074건으로 감소하여 68.3% 이상 감소했다.
- GILBERT는 이전 참조 탐지에서 $F_1$ 점수 0.84를 기록하여 FilBERT+GPT-3 파이프라인($F_1 = 0.56$)보다 정확도와 비용 효율성 측면에서 뛰어났다.
- 정성적 분석 결과, CXR-ReDonE는 기존 모델보다 훨씬 적은 환상적인 이전 검사 참조를 포함한 진단적으로 정확한 보고서를 생성하는 것으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.