Skip to main content
QUICK REVIEW

[논문 리뷰] Auxiliary Signal-Guided Knowledge Encoder-Decoder for Medical Report Generation

Mingjie Li, Fuyu Wang|arXiv (Cornell University)|2020. 06. 06.
Multimodal Machine Learning Applications참고 문헌 40인용 수 21
한 줄 요약

이 논문은 내부 시각적 영역 특징과 외부 의학 교과서 지식을 통합하여 방사선 전문의의 임상 워크플로우를 모방하는 보조 신호 유도 지식 인코더-디코더(ASGK)를 제안한다. 시각적 주의와 언어적 지식을 위한 보조 신호를 활용함으로써 ASGK는 더 정밀한 의료 태그 분류를 향상시키고, 더 정확하고 의미적으로 일관된 보고서를 생성하여 CX-CHR 및 새로운 코로나19 CT 보고서 데이터셋에서 최신 기술을 초월한다.

ABSTRACT

Beyond the common difficulties faced in the natural image captioning, medical report generation specifically requires the model to describe a medical image with a fine-grained and semantic-coherence paragraph that should satisfy both medical commonsense and logic. Previous works generally extract the global image features and attempt to generate a paragraph that is similar to referenced reports; however, this approach has two limitations. Firstly, the regions of primary interest to radiologists are usually located in a small area of the global image, meaning that the remainder parts of the image could be considered as irrelevant noise in the training procedure. Secondly, there are many similar sentences used in each medical report to describe the normal regions of the image, which causes serious data bias. This deviation is likely to teach models to generate these inessential sentences on a regular basis. To address these problems, we propose an Auxiliary Signal-Guided Knowledge Encoder-Decoder (ASGK) to mimic radiologists' working patterns. In more detail, ASGK integrates internal visual feature fusion and external medical linguistic information to guide medical knowledge transfer and learning. The core structure of ASGK consists of a medical graph encoder and a natural language decoder, inspired by advanced Generative Pre-Training (GPT). Experiments on the CX-CHR dataset and our COVID-19 CT Report dataset demonstrate that our proposed ASGK is able to generate a robust and accurate report, and moreover outperforms state-of-the-art methods on both medical terminology classification and paragraph generation metrics.

연구 동기 및 목표

  • 기존 의료 보고서 생성 모델이 모든 영상 영역을 동일하게 취급하고 정상성 기술이 빈번히 반복되면서 발생하는 데이터 편향 문제를 해결하기 위해.
  • 이상 부위에 집중하고 교과서에서 얻은 의료 도메인 지식을 통합하여 방사선 전문의의 임상 워크플로우를 모방하기 위해.
  • 보조 신호를 통해 다중 레이블 의료 태그 분류 및 보고서 생성의 데이터 비효율성과 편향을 줄이기 위해.
  • 방사선 보고서의 의료 용어 분류 및 자연어 생성 품질을 모두 향상시키기 위해.
  • 새로운 임상적으로 관련성이 높은 코로나19 CT 보고서 데이터셋에서 접근법을 검증하고 최신 기술 방법과 비교하기 위해.

제안 방법

  • 이상 영역의 주의 유도 특징 융합에서 유도된 내부 보조 신호를 도입하여 시각적 인코딩을 안내한다.
  • 대규모 의학 교과서에서 유도된 외부 보조 신호를 활용하여 자연어 디코더의 의료 지식 기억을 사전 학습한다.
  • 기존 의료 지식을 통합하고 시각적 및 언어적 표현 간의 다리를 놓기 위해 의료 지식 그래프 인코더를 사용한다.
  • 다중 레이블 의료 태그 분류에서 클래스 불균형 문제를 완화하기 위해 훈련 중에 포칼 손실을 적용한다.
  • 사전 학습된 GPT 스타일 디코더와 지식 강화된 인코더를 조합하여 의미적으로 일관되고 세밀한 보고서를 생성한다.
  • 다양한 의료 영상 도메인에 대한 일반화 능력과 탄탄함을 평가하기 위해 방사선 전문의가 전문적으로 애너테이션한 보고서를 기반으로 새로운 코로나19 CT 보고서 데이터셋(COV-CTR)을 구축한다.

실험 결과

연구 질문

  • RQ1보조 신호는 의료 보고서 생성에서 이방 부위의 탐지에 어떻게 기여하고, 관련 없는 영역에서 유발되는 노이즈를 어떻게 줄일 수 있는가?
  • RQ2외부 의학 교과서 신호는 생성된 보고서의 의미 일관성과 정확도에 어느 정도 기여하는가?
  • RQ3정상 소견이 훈련 데이터에서 지배적인 경우 포칼 손실은 다중 레이블 의료 태그 분류에서 데이터 편향을 어떻게 완화하는가?
  • RQ4내부 및 외부 보조 신호의 통합은 이러한 신호가 없는 기준 모델보다 더 높은 성능을 내는가?
  • RQ5제안된 ASGK 프레임워크는 코로나19 CT 스캔을 포함한 다양한 의료 영상 도메인에 대해 얼마나 일반화 가능한가?

주요 결과

  • ASGK는 기준 모델 대비 CX-CHR 데이터셋에서 의료 태그 분류 정확도를 4.5% 향상시켰으며, 자동 평가 지표에서 15.6%의 상대적 향상을 보였다.
  • 내부 보조 신호의 포함으로 CX-CHR 데이터셋에서 CIDER-D 점수는 15.6% 향상되었고, ROUGE-L은 1.4%, BLEU는 0.6% 향상되었다.
  • 외부 보조 신호의 영향으로 CX-CHR 데이터셋에서 CIDER-D 점수는 289.7%에서 317.2%로, ROUGE-L은 59.1%에서 66.9%로 상승하여 보고서 품질 향상이 뚜렷하게 나타났다.
  • 표준 교차 엔트로피 대비 포칼 손실은 두 데이터셋에서 AUC 지표의 열화를 각각 0.9%와 0.7% 감소시켜 레이블 불균형 문제에 대한 처리 능력 향상을 입증했다.
  • 외부 신호 없이 모델은 반복적인 문장을 생성하고 데이터 편향을 완화하지 못함으로써, 외부 지식이 의미 일관성에 결정적인 역할을 한다는 점을 확인했다.
  • 절단 실험 결과 내부 신호가 태그 탐지와 세밀한 기술 향상에 기여하는 반면, 외부 신호는 주로 생성된 보고서의 유창성과 일관성 향상에 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.