Skip to main content
QUICK REVIEW

[논문 리뷰] Explainability Matters: Backdoor Attacks on Medical Imaging

Munachiso Nwadike, Takumi Miyawaki|arXiv (Cornell University)|2020. 12. 30.
COVID-19 diagnosis using AI참고 문헌 39인용 수 5
한 줄 요약

이 논문은 흉부 X선 데이터셋에 3×3 픽셀 트리거를 주입하여 다중 레이블 질병 분류를 조작하는 백도어 공격을 조사한다. Grad-CAM 해석 가능성 기법을 사용하여, 백도어가 정교하게 삽입되었음을 입증하며, 감염된 이미지에서는 1.00 AUROC, 정상 이미지에서는 0.85 AUROC를 기록한다. 해석 가능성 기법은 특성 맵에서 트리거를 국소화할 수 있으며, 모델 오염 탐지에 있어 그 역할을 부각시킨다.

ABSTRACT

Deep neural networks have been shown to be vulnerable to backdoor attacks, which could be easily introduced to the training set prior to model training. Recent work has focused on investigating backdoor attacks on natural images or toy datasets. Consequently, the exact impact of backdoors is not yet fully understood in complex real-world applications, such as in medical imaging where misdiagnosis can be very costly. In this paper, we explore the impact of backdoor attacks on a multi-label disease classification task using chest radiography, with the assumption that the attacker can manipulate the training dataset to execute the attack. Extensive evaluation of a state-of-the-art architecture demonstrates that by introducing images with few-pixel perturbations into the training set, an attacker can execute the backdoor successfully without having to be involved with the training procedure. A simple 3$ imes$3 pixel trigger can achieve up to 1.00 Area Under the Receiver Operating Characteristic (AUROC) curve on the set of infected images. In the set of clean images, the backdoored neural network could still achieve up to 0.85 AUROC, highlighting the stealthiness of the attack. As the use of deep learning based diagnostic systems proliferates in clinical practice, we also show how explainability is indispensable in this context, as it can identify spatially localized backdoors in inference time.

연구 동기 및 목표

  • 다중 레이블 의료 영상 분류에서 백도어 공격의 가능성과 영향을 조사하는 것, 특히 흉부 레이저그래피에서의 적용을 중심으로 한다.
  • 다양한 감염 비율에서 트리거가 감염된 이미지와 정상 이미지에서 모델 성능에 미치는 영향을 평가하는 것.
  • 추론 중에 공간적으로 국소화된 백도어를 탐지하는 데 있어 Grad-CAM과 같은 해석 가능성 기법의 역할을 탐색하는 것.
  • 트리거가 다양한 공간 위치에 배치되었을 때 최신 기술 모델의 백도어 공격에 대한 강건성을 평가하는 것.
  • 해석 가능성 기법이 임상 AI 시스템에서 모델 오염을 식별하는 보조 도구로 기능할 수 있음을 보여주는 것.

제안 방법

  • 공격자는 트레이닝 세트에 3×3 픽셀 트리거가 포함된 이미지를 주입하며, 이는 목표 질병 레이블과 연관지워지지만, 다른 조건에 대한 원래 레이블은 유지된다.
  • 유해 샘플이 포함된 다중 레이블 흉부 X선 데이터셋을 기반으로 최신 기술의 DenseNet-121 모델을 훈련시어 백도어 효과를 평가한다.
  • 해석 가능성은 최종 및 중간 합성곱 레이어에서 Gradient-weighted Class Activation Mapping (Grad-CAM)를 사용하여 트리거로 인한 주의 분포 변화를 시각화한다.
  • 트리거 위치와 감염 비율이 다양할 때 감염된 이미지와 정상 이미지에서 AUROC 및 공격 성공률(ASR)을 사용해 모델 성능을 평가한다.
  • 다른 훈련 에포크에서 정상 이미지와 감염된 이미지 간의 시각화 지도를 비교하여 트리거가 특성 주의에 미치는 영향을 추적한다.
  • 감염 비율(ε = 0.001에서 0.5까지)을 다양하게 설정하여 추론 시 정교함을 평가한다.

실험 결과

연구 질문

  • RQ13×3 픽셀 백도어 트리거는 감지되지 않도록 다중 레이블 흉부 X선 분류 모델을 성공적으로 조작할 수 있는가?
  • RQ2트리거의 공간적 국소화가 모델이 백도어를 학습하고 적용하는 데 미치는 영향은 어떠한가?
  • RQ3백도어가 정상 이미지에서 성능을 얼마나 떨어뜨리는가에 따라 정교함이 어떻게 나타나는가?
  • RQ4Grad-CAM과 같은 해석 가능성 기법은 트리거 위치로의 주의 분포 이동을 시각화함으로써 백도어 존재를 탐지할 수 있는가?
  • RQ5테스트 세트에 포함된 감염 이미지 비율이 모델의 전체 성능과 탐지 가능성에 어떤 영향을 미치는가?

주요 결과

  • 3×3 픽셀 트리거는 감염된 이미지에서 1.000 AUROC를 기록하여 백도어 클래스를 거의 완벽하게 탐지함을 나타낸다.
  • 정상 이미지에서는 AUROC가 0.852를 유지하여 공격의 정교함과 낮은 탐지 가능성에 기여함을 입증한다.
  • 트리거가 중심에 고정되어 있을 경우 공격 성공률(ASR)은 0.994로 높았고, 무작위 배치일 경우 0.963로 유지되어 공간적 변동성에 대한 강건성을 보였다.
  • Grad-CAM 시각화 결과, 모델의 주의가 최종 및 중간 합성곱 레이어 모두에서 트리거 위치로 이동하는 것으로 나타났으며, 특히 초기 훈련 에포크에서 두드러졌다.
  • 중간 레이어 Grad-CAM 지ap은 트리거를 더 정밀하게 국소화함을 확인하여, 저수준 특징이 백도어 탐지에 효과적임을 입증했다.
  • 낮은 감염 비율(ε = 0.001)에서도 AUROC가 0.809–0.852를 유지하여 공격가 여전히 효과적이며 스케일링 시에도 탐지되지 않음을 나타냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.