Skip to main content
QUICK REVIEW

[논문 리뷰] Controllable Chest X-Ray Report Generation from Longitudinal Representations

Francesco Dalla Serra, Chaoyang Wang|arXiv (Cornell University)|2023. 10. 09.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 이전 및 현재 영상의 시각적 표현을 융합하여 종단간 종합 표현을 생성하고, 문장 해부학 드롭아웃을 통해 언어 모델을 훈련시켜 특정 해부학적 영역에 대해서만 보고서를 생성함으로써 제어 가능하고 종단간 흉부 X선 보고서 생성을 위한 새로운 프레임워크를 제안한다. 이 방법은 MIMIC-CXR 데이터셋에서 최신 기술 성능을 달성하여 정확하고 해석 가능하며 임상적으로 관련성이 있는 자동 보고서를 전체 해부학적 영역 제어 하에 제공한다.

ABSTRACT

Radiology reports are detailed text descriptions of the content of medical scans. Each report describes the presence/absence and location of relevant clinical findings, commonly including comparison with prior exams of the same patient to describe how they evolved. Radiology reporting is a time-consuming process, and scan results are often subject to delays. One strategy to speed up reporting is to integrate automated reporting systems, however clinical deployment requires high accuracy and interpretability. Previous approaches to automated radiology reporting generally do not provide the prior study as input, precluding comparison which is required for clinical accuracy in some types of scans, and offer only unreliable methods of interpretability. Therefore, leveraging an existing visual input format of anatomical tokens, we introduce two novel aspects: (1) longitudinal representation learning -- we input the prior scan as an additional input, proposing a method to align, concatenate and fuse the current and prior visual information into a joint longitudinal representation which can be provided to the multimodal report generation model; (2) sentence-anatomy dropout -- a training strategy for controllability in which the report generator model is trained to predict only sentences from the original report which correspond to the subset of anatomical regions given as input. We show through in-depth experiments on the MIMIC-CXR dataset how the proposed approach achieves state-of-the-art results while enabling anatomy-wise controllable report generation.

연구 동기 및 목표

  • 시간이 제한된 환경에서 자동화되고 정확하며 해석 가능한 방사선 보고서 작성의 임상적 필요를 해결하기 위해.
  • 보고서 생성 과정에 종단간 시각적 표현을 통합하여 현재와 이전 CXR 스캔 간 비교를 가능하게 하기 위해.
  • 사용자가 지정한 해부학적 영역에 대해서만 보고서를 생성하도록 생성기 훈련을 통해 모델의 해석 가능성을 향상시키기 위해.
  • 통제된 해부학적 초점을 가진 부분 보고서 생성을 통해 임상적 유용성을 향상시키기 위해.
  • 전체 및 부분 보고서 생성에서 최신 기술 성능를 달성하면서도 임상적 발견에 높은 일치성을 유지하기 위해.

제안 방법

  • 모델은 현재 및 이전 CXR 스캔에서 해부학적 영역 표현을 추출하기 위해 Faster R-CNN을 사용한다.
  • 공간적 및 의미적 대응 관계를 통해 이전 및 현재 스캔 간 해당하는 해부학적 영역을 정렬한다.
  • 정렬된 표현은 학습 가능한 투영 모듈을 통해 연결된 종단간 표현으로 압축된다.
  • 연결된 표현은 임상적 지시어 필드와 함께 복수 모odal 언어 모델에 입력되어 보고서 생성에 사용된다.
  • 새로운 훈련 전략인 문장 해부학 드롭아웃은 훈련 중에 일부 해부학적 영역을 무작위로 마스킹하여, 모델이 보여주는 영역에만 관련된 문장만 생성하도록 유도한다.
  • 종단 간 모델은 해부학적으로 정밀하고 종단간 스캔 데이터와 맥락적으로 일관된 보고서를 생성하도록 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1이전 및 현재 CXR 스캔의 종단간 표현이 자동 보고서 생성의 정확성과 임상적 관련성에 향상 효과를 미칠 수 있는가?
  • RQ2문장 해부학 드롭아웃이 사용자 지정된 해부학적 영역에 해당하는 문장만 생성하도록 언어 모델을 효과적으로 훈련시켜 제어 가능성과 해석 가능성을 향상시킬 수 있는가?
  • RQ3제안된 방법은 전체 보고서, 부분 보고서, 추적 보고서 생성에서 이전 방법들과 비교해 어떻게 성능을 발휘하는가?
  • RQ4모델의 성능가 이전 스캔 정보와 통제된 해부학적 입력의 포함 여부에 얼마나 의존하는가?
  • RQ5초기 검사와 추적 검사 유형을 포함한 다양한 보고서 유형으로 일반화되어 일관된 성능을 유지할 수 있는가?

주요 결과

  • 제안된 방법은 MIMIC-CXR 데이터셋에서 최신 기술 성능를 달성하였으며, 이전 스캔과 문장 해부학 드롭아웃을 모두 사용할 경우 전체 보고서 생성에서 F1 스코어 0.589, 추적 스캔에서 0.599를 기록하였다.
  • 부분 보고서 생성에서 기준 모델보다 뚜렷한 성능 향상을 보였으며, 이전 스캔과 문장 해부학 드롭아웃을 모두 사용할 경우 F1 스코어 0.683을 기록한 반면, 이를 사용하지 않을 경우 0.303에 그쳤다.
  • 생성된 보고서의 길이 분포는 실제 데이터와 유사하여, 기준 방법 대비 자연스러운 보고서 구조와 더 잘 일치함을 시사한다.
  • 절단 실험 결과 종단간 표현 학습과 문장 해부학 드롭아웃이 최적 성능 달성에 필수적임을 확인하였으며, 특히 추적 및 부분 보고서 설정에서 두 요소의 기여가 두드러졌다.
  • 정성적 결과 분석에서, 특히 부분 보고서 생성 시 제안된 방법을 사용할 경우 누락된 해부학적 영역에 대한 환각 현상이 감소하는 것으로 나타났다.
  • 모든 평가 설정에서 임상적 효율성 지표인 F1, 정밀도, 재현율 모두에서 향상된 성능를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.