Skip to main content
QUICK REVIEW

[논문 리뷰] Bait and Switch: Online Training Data Poisoning of Autonomous Driving Systems

Naman Patel, P. Krishnamurthy|arXiv (Cornell University)|2020. 11. 08.
Adversarial Robustness in Machine Learning참고 문헌 21인용 수 5
한 줄 요약

이 논문은 자율주행 시스템의 온라인 학습 기간 동안 환경을 물리적으로 조작함으로써 깊이 신경망이 간접적인 상관관계(예: 간판과 신호등 상태 간의 상관관계)를 학습하게 하는 새로운 클린라벨 데이터 훼손 공격—'베이트 앤 스위치'—를 제안한다. 100%의 신호등이 훼손된 경우 모델의 정확도가 33.89%로 떨어지며, 최종 레이어만 미세조정된 상태에서도 여전히 심각한 취약성을 드러내며, 실제 온라인 학습 시스템에서의 잠재적 위험을 입증한다.

ABSTRACT

We show that by controlling parts of a physical environment in which a pre-trained deep neural network (DNN) is being fine-tuned online, an adversary can launch subtle data poisoning attacks that degrade the performance of the system. While the attack can be applied in general to any perception task, we consider a DNN based traffic light classifier for an autonomous car that has been trained in one city and is being fine-tuned online in another city. We show that by injecting environmental perturbations that do not modify the traffic lights themselves or ground-truth labels, the adversary can cause the deep network to learn spurious concepts during the online learning phase. The attacker can leverage the introduced spurious concepts in the environment to cause the model's accuracy to degrade during operation; therefore, causing the system to malfunction.

연구 동기 및 목표

  • 온라인 학습을 수행하는 자율주행 시스템에 대한 물리적, 클린라벨 데이터 훼손 공격의 가능성 여부를 조사하는 것.
  • 학습 데이터나 레이블을 수정하지 않고도 실제 환경을 조작하여 DNN에 간접적인 상관관계를 유도할 수 있는 방법을 탐색하는 것.
  • 부분적인 미세조정 및 환경 변화와 같은 다양한 조건에서 이러한 공격의 강건성과 일반화 능력을 평가하는 것.
  • 심지어 최소한의 물리적 수정만으로도 구현된 모델의 성능 저하가 발생할 수 있음을 입증하는 것.

제안 방법

  • 공격자는 온라인 학습 단계 동안 새로운 도시의 신호등 근처 전자 간판에 광고 공간을 설치하거나 구매한다.
  • 공격자는 학습 기간 동안 특정 이미지(예: 개, 고양이, 물고기)를 간판에 표시하고, 해당 이미지와 신호등 상태(빨간색, 노란색, 초록색)를 동기화시킨다(베이트 단계).
  • DNN는 간판 이미지와 신호등 상태 간에 간접적인 상관관계를 학습하게 되며, 이를 예측 특성으로 오해한다.
  • 배포 단계에서는 간판의 이미지-신호등 대응 관계를 뒤집는다(스위치 단계), 이로 인해 오분류가 발생한다.
  • 공격는 CARLA 시뮬레이터를 사용하여 실세계 유사 데이터로 훈련된 DNN 기반의 신호등 분류기에서 평가된다. 환경적 요동을 통제하는 조건에서 진행된다.
  • 공격의 효과는 훼손된 신호등 수, 학습 가능한 파라미터 수, 간판 이미지의 다양성 등 다양한 조건에서 평가된다.

실험 결과

연구 질문

  • RQ1온라인 학습 기간 동안 물리적, 클린라벨 환경 수정이 DNN 기반의 신호등 분류기에서 지속적인 간접적인 상관관계를 유도할 수 있는가?
  • RQ2온라인 학습 중 네트워크의 일부 레이어만 미세조정될 경우 공격의 효과는 어떠한가?
  • RQ3간판 위치가 훈련 시점과 다를 경우 테스트 시나리오로의 공격 일반화 능력은 어떠한가?
  • RQ4훼손된 환경 자극에 노출된 신호등 비율이 증가함에 따라 공격 성능는 어떻게 변화하는가?
  • RQ5간판 이미지의 선택이 공격 성공률에 영향을 미치는가?

주요 결과

  • 100%의 신호등이 악성 간판으로 훼손된 경우, 모델의 정확도는 테스트 세트에서 98.25%에서 33.89%로 감소했다.
  • 37개의 신호등 중 3개만 훼손된 경우에도, 훼손된 위치에서는 정확도가 77%로 떨어지고, 전체 위치 평균은 85%로 유지되어 강력한 일반화 능력을 보였다.
  • 최종 합성 및 선형 레이어만 재학습한 경우에도 공격가 효과적이었으며, 훼손된 위치에서 정확도는 73.7%로 떨어졌다.
  • 간판 위치가 이동된 테스트 시나리오로도 공격가 일반화되었으며, 유사한 정확도 저하(37개 중 18개가 훼손된 경우 60% 정확도)를 유지했다.
  • 다양한 간판 이미지(예: 동물, 무늬)를 사용한 경우 공격 성공률가 유사하게 유지되었으며, 18개의 신호등이 훼손된 경우 정확도는 99.28%에서 64%로 감소했다.
  • 학습 데이터나 레이블을 수정하지 않고도 물리적 환경 조작만으로도 성능 저하가 심각하게 발생함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.