[논문 리뷰] Indication as Prior Knowledge for Multimodal Disease Classification in Chest Radiographs with Transformers
이 논문은 임상적 지시 사항 필드—영상 이전에 제공되는 자유형 텍스트—를 사전 지식으로 활용하여 흉부 X선 질병 분류를 향상시키는 다중모달 트랜스포머 모델을 제안한다. ResNet-152에서 유도된 이미지 특징과 함께 단모달 BERT 모델을 미세조정함으로써, MIMIC-CXR에서 평균 마이크로 AUROC 87.8%를 달성하여 이전의 단모달(84.4%) 및 다중모달(86.0%) 접근 방식을 능가한다.
When a clinician refers a patient for an imaging exam, they include the reason (e.g. relevant patient history, suspected disease) in the scan request; this appears as the indication field in the radiology report. The interpretation and reporting of the image are substantially influenced by this request text, steering the radiologist to focus on particular aspects of the image. We use the indication field to drive better image classification, by taking a transformer network which is unimodally pre-trained on text (BERT) and fine-tuning it for multimodal classification of a dual image-text input. We evaluate the method on the MIMIC-CXR dataset, and present ablation studies to investigate the effect of the indication field on the classification performance. The experimental results show our approach achieves 87.8 average micro AUROC, outperforming the state-of-the-art methods for unimodal (84.4) and multimodal (86.0) classification. Our code is available at https://github.com/jacenkow/mmbt.
연구 동기 및 목표
- 영상의 이유를 기술하는 임상적 텍스트인 지시 사항 필드를 통합하여 다중모달 흉부 X선 분류를 향상시키기.
- 단모달로 사전 훈련된 BERT가 이미지 특징과 함께 미세조정될 때 다중모달 상호작용을 효과적으로 학습할 수 있는지 평가하기.
- 일반적인 텍스트 오류 및 누락된 지시 사항 필드에 대한 모델의 강건성 평가하기.
- 기존의 비침습적 임상 정보만을 사용하여 다중모달 질병 분류의 강력한 베이스라인 수립하기.
제안 방법
- 이미지는 ResNet-152 분류기에서 유도된 특징으로 인코딩된 이중 이미지-텍스트 입력에 대해 단모달로 사전 훈련된 BERT 모델을 미세조정한다.
- 영상 분류를 안내하고 주의 메커니즘을 향상시키기 위해 방사선 검사 보고서의 지시 사항 필드를 임상 지식의 원천으로 사용한다.
- 교차 주의 메커니즘을 통해 이미지 및 텍스트 임bedding을 함께 처리하기 위해 다중모달 BERT(MMBT) 아키텍처를 적용한다.
- 다중 레이블 분류 손실을 사용하여 MIMIC-CXR 데이터셋에서 모델을 엔드 투 엔드로 훈련한다.
- 적대적 편향을 사용하여 강건성 평가: 문자 교환, 키보드 오류, 동의어 대체, 누락/교환 입력.
- 이미지 및 텍스트 특징을 별도로 처리한 후 트랜스포머 인코더에서 융합하는 후기 융합 전략을 사용한다.

실험 결과
연구 질문
- RQ1단모달로 사전 훈련된 BERT 모델이 흉부 X선 영상과 임상적 지시 사항 텍스트 간의 다중모달 상호작용을 효과적으로 학습할 수 있는가?
- RQ2지시 사항 필드를 사전 지식으로 통합할 경우, 이미지 전용 또는 후기 융합 기반 베이스라인과 비교해 분류 성능이 향상되는가?
- RQ3타원, 동의어 사용 또는 누락된 지시 사항 필드와 같은 일반적인 텍스트 오류에 대해 모델의 강건성은 어떠한가?
- RQ4다른 환자의 지시 사항이 충돌적으로 제공될 경우 모델의 성능이 크게 떨어지는가?
- RQ5지시 사항 필드가 누락되었을 경우 모델의 성능이 이미지 전용 베이스라인과 유사하게 유지되는가?
주요 결과
- 제안된 방법은 MIMIC-CXR 데이터셋에서 평균 마이크로 AUROC 87.8%를 달성하여 이전의 최신 기술 단모달(84.4%) 및 다중모달(86.0%) 방법을 능가한다.
- 모델은 철자 오류에 대해 강력한 강건성을 보이며, 키보드 오류 상황에서 최대 -1.7% 마이크로 AUROC 하락을 보인다.
- 지시 사항 필드가 누락되거나 정지어로 대체될 경우, 모델의 성능은 ResNet-50 이미지 전용 기반선과 일치하게 떨어지며, 가용한 텍스트 입력에 의존함을 시사한다.
- 다른 환자의 텍스트로 지시 사항을 대체할 경우 마이크로 AUROC에서 -9.8% 및 매크로 AUROC에서 -16.6%의 심각한 성능 저하가 발생하여, 모델이 결정 내림에 있어 두 모odal 모두를 활용함을 확인한다.
- 모델은 14개 질병 전반에서 높은 성능을 유지하며, '보조 기구'에 대해 최고의 AUROC 92.2%와 '흉막 축적'에 대해 88.6%를 기록한다.
- 이 방법은 지시 사항 필드에서 유래한 사전 임상 지식이 미세조정된 BERT 기반 아키텍처에 의해 효과적으로 활용되어 흉부 X선 분류의 진단 정확도가 향상됨을 보여준다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.