[논문 리뷰] Defending against adversarial attacks on medical imaging AI system, classification or detection?
이 논문은 의료 영상 AI 시스템이 알려지지 않은 적대적 공격에 대비하여 강건성을 향상시키기 위해 준감독 적대적 훈련(SSFAT)과 무감독 적대적 탐지(UAD)를 조합한 하이브리드 방어 프레임워크를 제안한다. 제한된 레이블된 데이터와 비레이블 데이터를 활용해 SSAT를 수행하고, UAD를 통해 분포 외 적대적 샘플을 탐지함으로써 강력한 PGD 공격 하에서 0.215의 적대적 리스크를 달성한다. 이는 기존의 기준보다 유의미하게 낮은 수치로, OCT 영상 데이터에서 뛰어난 강건성을 입증한다.
Medical imaging AI systems such as disease classification and segmentation are increasingly inspired and transformed from computer vision based AI systems. Although an array of adversarial training and/or loss function based defense techniques have been developed and proved to be effective in computer vision, defending against adversarial attacks on medical images remains largely an uncharted territory due to the following unique challenges: 1) label scarcity in medical images significantly limits adversarial generalizability of the AI system; 2) vastly similar and dominant fore- and background in medical images make it hard samples for learning the discriminating features between different disease classes; and 3) crafted adversarial noises added to the entire medical image as opposed to the focused organ target can make clean and adversarial examples more discriminate than that between different disease classes. In this paper, we propose a novel robust medical imaging AI framework based on Semi-Supervised Adversarial Training (SSAT) and Unsupervised Adversarial Detection (UAD), followed by designing a new measure for assessing systems adversarial risk. We systematically demonstrate the advantages of our robust medical imaging AI system over the existing adversarial defense techniques under diverse real-world settings of adversarial attacks using a benchmark OCT imaging data set.
연구 동기 및 목표
- 레이블된 데이터가 부족한 상황에서 의료 영상 AI 시스템을 적대적 공격으로부터 방어하는 데 도전하는 것.
- 의료 영상에서 전경과 배경의 유사성으로 인해 적대적 샘플과 정상 샘플을 구분하기 어려운 문제를 해결하는 것.
- 적대적 샘플의 밀도 추정에 의존하지 않고도 알려지지 않은 이질적인 적대적 공격에 대비한 강건성을 향상시키는 것.
- 정상 이미지에 대한 높은 정확도를 유지하면서도 분포 외 적대적 샘플을 효과적으로 탐지하고 완화하는 방어 프레임워크를 개발하는 것.
- 다양한 공격 설정 하에서 시스템 강건성을 종합적으로 평가할 수 있도록 새로운 적대적 리스크 측정 기준을 도입하는 것.
제안 방법
- 레이블된 데이터와 비레이블 데이터를 모두 활용해 의사 레이블을 생성하는 준감독 적대적 훈련(SSFAT)을 적용하여, 분포 내 적대적 샘플에 대한 강건성을 향상시킨다.
- 잠재 특징 공간에서 혼합 모델 밀도 추정 기반으로 무감독 적대적 탐지(UAD)를 적용하여, 공격 유형에 대한 사전 지식 없이도 분포 외 적대적 샘플을 탐지한다.
- 특징 추출 및 적대적 강건성 확보를 위해 ImageNet에서 사전 훈련된 ResNet-18을 기반 네트워크로 사용한다.
- 배치 크기가 64이고 SSAT 손실 함수 내 무게 조정 하이퍼파rameter λ=5인 조건에서 SGD로 10 에포크 동안 모델을 훈련한다.
- T-SNE 시각화를 활용해 정상 샘플과 적대적 샘플 간의 특징 공간 분포 이동을 분석한다.
- 예측 정확도와 탐지 성능를 종합적으로 반영하는 새로운 적대적 리스크 측정 기준을 도입하여 시스템 강건성 평가를 종합적으로 수행한다.
실험 결과
연구 질문
- RQ1제한된 레이블된 데이터가 있는 의료 영상 분류에서 준감독 적대적 훈련 기법이 효과적으로 강건성을 향상시킬 수 있는가?
- RQ2공격 유형에 대한 사전 지식 없이도 무감독 적대적 탐지 기법이 분포 외 적대적 샘플을 효과적으로 식별할 수 있는가?
- RQ3백색 상자 공격 하에서 SSAT와 UAD의 조합이 기존 방어 방법에 비해 적대적 리스크 측면에서 어떻게 비교되는가?
- RQ4특히 더 강력한 공격에 대비할 때, UAD가 강건 훈련과 결합되었을 경우 적대적 리스크가 얼마나 감소하는가?
- RQ5제안된 시스템은 알려지지 않은 공격에 대비해 강력한 방어 기능을 확보하면서도 정상 이미지에 대한 높은 성능을 유지하는가?
주요 결과
- UAD는 모든 클래스에서 평균 AUPRC가 97.3%를 기록하여 분포 외 적대적 샘플을 효과적으로 식별함을 보여준다.
- ε=0.005인 PGD 공격 하에서 제안된 시스템은 적대적 리스크를 0.215로 낮췄으며, 이는 다음으로 우수한 기준(0.634)보다 유의미하게 낮은 수치이다.
- 더 강력한 PGD 공격(ε=0.01) 하에서 UAD 적용 시 적대적 리스크는 0.912에서 0.450으로 감소하여 리스크가 50% 감소함을 보였다.
- 강력한 공격 조건에서도 정상 이미지 분류 정확도가 높은 편(적대적 예측 샘플에 대한 예측 정확도 86.4%)을 유지하여 강건성을 입증했다.
- FGSM, PGD, C&W 공격을 포함한 모든 공격 유형에서 자연 훈련, GCE 손실, 표준 적대적 훈련 대비 SSAT가 뛰어난 성능을 보였으며, 특히 강력한 공격에서 두드러진 성능 향상을 보였다.
- 제안된 적대적 리스크 측정 기준은 시스템의 취약성을 효과적으로 반영하였으며, UAD가 강력한 훈련 방법을 사용할 경우에도 강건성을 크게 향상시킴을 드러냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.