Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Attacks on Monocular Depth Estimation

Ziqi Zhang, Xinge Zhu|arXiv (Cornell University)|2020. 03. 23.
Adversarial Robustness in Machine Learning참고 문헌 62인용 수 14
한 줄 요약

이 논문은 단안 영상 깊이 추정에 대한 적대적 공격의 첫 번째 체계적 연구를 제시하며, 비대상, 대상, 통용 공격 시나리오를 도입한다. 최신 공격 기법을 적응시키고 깊이 및 세그멘테이션 감독을 활용하는 다중 작업 공격 전략을 제안함으로써, 저자들은 특정 객체에 대해 깊이 예측을 최대 4배(예: 20m에서 80m로) 왜곡시킬 수 있음을 입증한다. 이는 자율주행과 같은 안전 중심 응용 분야에서 사용되는 깊이 추정 모델에 심각한 취약성을 드러낸다.

ABSTRACT

Recent advances of deep learning have brought exceptional performance on many computer vision tasks such as semantic segmentation and depth estimation. However, the vulnerability of deep neural networks towards adversarial examples have caused grave concerns for real-world deployment. In this paper, we present to the best of our knowledge the first systematic study of adversarial attacks on monocular depth estimation, an important task of 3D scene understanding in scenarios such as autonomous driving and robot navigation. In order to understand the impact of adversarial attacks on depth estimation, we first define a taxonomy of different attack scenarios for depth estimation, including non-targeted attacks, targeted attacks and universal attacks. We then adapt several state-of-the-art attack methods for classification on the field of depth estimation. Besides, multi-task attacks are introduced to further improve the attack performance for universal attacks. Experimental results show that it is possible to generate significant errors on depth estimation. In particular, we demonstrate that our methods can conduct targeted attacks on given objects (such as a car), resulting in depth estimation 3-4x away from the ground truth (e.g., from 20m to 80m).

연구 동기 및 목표

  • 자율주행과 같은 안전 중심 응용 분야에서 단안 영상 깊이 추정 모델의 적대적 공격에 대한 취약성을 조사하는 것.
  • 깊이 추정에 특화된 공격 시나리오—비대상, 대상, 통용 공격—의 분류 체계를 정의하고 기준을 설정하는 것.
  • 분류 및 세그멘테이션에서의 기존 적대적 공격 기법을 회귀 기반 과제인 깊이 추정에 적응시키는 것.
  • 깊이 추정과 의미적 세그멘테이션을 동시에 최적화하여 통용 공격 성능을 향상시키는 새로운 다중 작업 공격 전략을 제안하는 것.
  • KITTI 데이터셋에서 다양한 백본 아키텍처(예: ResNet-50, VGG-16)가 적대적 흐트러짐에 어떻게 반응하는지 평가하는 것.

제안 방법

  • 저자들은 세 가지 공격 시나리오를 정의한다: 비대상(전역적으로 깊이를 왜곡), 대상(특정 객체의 깊이를 잘못 추정), 통용(여러 이미지에 동일한 흐트러짐 적용).
  • 공격를 분류에서 깊이 추정으로 확장하기 위해 FGSM, I-FGSM, MI-FGSM과 같은 최신 공격 기법을 적응시키며, 깊이 예측 손실에 대한 기울기 기반 최적화로 공격를 정식화한다.
  • 다중 작업 공격 전략을 도입하여, 깊이 추정과 의미적 세그멘테이션 감독을 포함하는 병합 손실 함수(가중치 w_depth = 0.5, w_semantic = 0.5)를 사용해 통용 흐트러짐을 최적화한다.
  • 백색 상자 설정에서 KITTI 데이터셋을 사용하여 깊이 추정 및 세그멘테이션 과제에 미세조정된 모델을 대상으로 공격를 수행한다.
  • 통용 적대적 흐트러짐은 여러 이미지에 걸쳐 깊이 추정 오차를 최대화하는 단일 흐트러짐 벡터를 최적화하여 생성된다.
  • 방법론은 다중 작업 손실 함수를 사용한다: L_total = w_depth × L_depth + w_semantic × L_semantic, 여기서 L_depth는 예측값과 진짜 깊이 사이의 RMSE이며, L_semantic는 세그멘테이션을 위한 교차 엔트로피 손실이다.

실험 결과

연구 질문

  • RQ1적대적 공격는 단안 영상 깊이 추정 예측을 효과적으로 왜곡할 수 있으며, 그 정도는 어느 정도인가?
  • RQ2비대상, 대상, 통용 공격와 같은 다양한 공격 유형이 깊이 추정 성능에 어떤 영향을 미치는가?
  • RQ3의미적 세그멘테이션에서의 감독 신호를 조합하면 통용 적대적 공격의 효과성을 깊이 추정에 높일 수 있는가?
  • RQ4모델 아키텍처(예: ResNet-50 대비 VGG-16)는 깊이 추정에서 적대적 공격에 대한 취약성에 어떤 영향을 미치는가?
  • RQ5특정 객체, 예를 들어 차량이나 보행자와 같은 객체의 깊이를 얼마나 극단적인 값으로 조작할 수 있는가?

주요 결과

  • 대상 공격는 특정 객체의 깊이 추정을 최대 4배로 왜곡할 수 있으며, 진짜 값에서 20m에서 80m로 예측을 이격시킨다.
  • 평균 깊이 추정 오차(RMSE)는 청소된 입력 대비 최대 10배까지 증가하여 모델의 심각한 취약성을 입증한다.
  • 테스트된 백본 중에서 ResNet-50가 가장 취약한 것으로 나타났으며, 성능이 높은 모델일수록 적대적 공격에 더 취약할 수 있다는 관찰과 일치한다.
  • 다중 작업 공격 전략은 통용 공격 성능을 크게 향상시키며, MI-FGSM은 단일 작업 설정 대비 ResNet-50에서 RMSE 9.757을 기록했다.
  • 통용 흐트러짐은 매우 효과적이고 도구적인데, 시각적 외관을 유지하면서도 다른 이미지 영역의 변화는 최소화하면서도 깊이 왜곡을 크게 유도한다. 그 예로 그림 2의 기둥 세부 정보 유지가 확인된다.
  • 공격는 목표 객체의 깊이를 임의의 값으로 조작할 수 있다—예를 들어 11.4m에서 80.8m까지—깊이 추정의 완전한 제어 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.