Skip to main content
QUICK REVIEW

[논문 리뷰] Improving the Transferability of Targeted Adversarial Examples through Object-Based Diverse Input

Junyoung Byun, Seungju Cho|arXiv (Cornell University)|2022. 03. 17.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 2D 적대적 예제를 다양한 시야 조건과 조명 조건 하에서 3D 객체에 투영함으로써 대상 공격의 전이성을 향상시키는 새로운 데이터 증강 방법인 객체 기반 다각도 입력(ODI)을 제안한다. 실제 3D 렌더링의 다양성을 활용함으로써, ImageNet에서의 평균 대상 공격 성공률을 기존 최고 수준의 방법 대비 28.3%에서 47.0%로 향상시킨다.

ABSTRACT

The transferability of adversarial examples allows the deception on black-box models, and transfer-based targeted attacks have attracted a lot of interest due to their practical applicability. To maximize the transfer success rate, adversarial examples should avoid overfitting to the source model, and image augmentation is one of the primary approaches for this. However, prior works utilize simple image transformations such as resizing, which limits input diversity. To tackle this limitation, we propose the object-based diverse input (ODI) method that draws an adversarial image on a 3D object and induces the rendered image to be classified as the target class. Our motivation comes from the humans' superior perception of an image printed on a 3D object. If the image is clear enough, humans can recognize the image content in a variety of viewing conditions. Likewise, if an adversarial example looks like the target class to the model, the model should also classify the rendered image of the 3D object as the target class. The ODI method effectively diversifies the input by leveraging an ensemble of multiple source objects and randomizing viewing conditions. In our experimental results on the ImageNet-Compatible dataset, this method boosts the average targeted attack success rate from 28.3% to 47.0% compared to the state-of-the-art methods. We also demonstrate the applicability of the ODI method to adversarial examples on the face verification task and its superior performance improvement. Our code is available at https://github.com/dreamflake/ODI.

연구 동기 및 목표

  • 기존 이미지 증강 기법에서의 입력 다양성 부족 문제를 해결하여 적대적 예제의 전이성을 향상시키는 것.
  • 2D 변형보다 더 현실적이고 다양한 데이터 증강 전략으로서 3D 객체 렌더링이 활용될 수 있는지 탐색하는 것.
  • 실제 세계의 시각적 변형을 시뮬레이션함으로써 소스 모델에 과적합되는 것을 방지하고 대상 적대적 예제의 강건성을 향상시키는 것.
  • 이론적 일반화 능력을 이미지 분류를 넘어 얼굴 인식 작업 등에도 적용할 수 있음을 입증하는 것.
  • 과도한 초모수 조정 없이도 실용적이고 효과적인 블랙박스 대상 공격을 위한 방법을 제공하는 것.

제안 방법

  • ODI 방법은 적대적 예제 생성 단계에서 2D 적대적 예제를 베개나 컵과 같은 3D 객체 표면에 투영한다.
  • 카메라 거리, 시점 각도, 조명 조건, 배경 유형 등을 랜덤화한 여러 3D 소스 객체를 활용한다.
  • 실제 세계의 시야, 조명, 가림 현상 등의 변형에 강건한 적대적 예제를 생성하기 위해 실제 세계의 시각 조건을 시뮬레이션한다.
  • 실제 재질과 조명 모델을 지원하는 3D 그래픽 엔진을 사용하여 렌더링을 수행함으로써 다양한 실제적인 입력 분포를 확보한다.
  • 표준 대상 공격 목표(예: 교차 엔트로피 손실)를 사용해 적대적 손실을 최적화하면서, 투영된 3D 렌더링 이미지가 대상 클래스로 분류되도록 강제한다.
  • 기존 공격 프레임워크(MI-FGSM, TI-FGSM 등)와 호환되며, 모멘텀 및 가상 적대적 훈련과 같은 기법과도 조합 가능하다.

실험 결과

연구 질문

  • RQ1표준 2D 데이터 증강 대비 3D 객체에 적대적 예제를 투영하는 것이 블랙박스 모델로의 전이성 향상에 기여하는가?
  • RQ23D 객체의 종류(예: 컵 vs. 베개) 선택이 대상 적대적 공격 성공률에 어떤 영향을 미치는가?
  • RQ3다양한 카메라 각도, 조명, 배경이 적대적 예제의 일반화 능력 향상에 실제로 기여하는가?
  • RQ4ODI 방법은 얼굴 인식과 같은 비이미지 분류 작업으로 효과적으로 확장될 수 있는가?
  • RQ5배경 유형과 렌더링 파라미터 범위의 변화가 최종 공격 성공률에 어떤 영향을 미치는가?

주요 결과

  • ODI 방법은 네 대의 소스 모델과 열 대의 타겟 모델을 대상으로 ImageNet에서 평균 대상 공격 성공률을 28.3%에서 47.0%로 높여 기존 최고 수준의 방법을 크게 능가한다.
  • 다양한 3D 객체(예: 베개, 컵)의 앙상블을 사용할 경우 단일 객체를 사용하는 것보다 높은 공격 성공률을 기록하며, 이는 객체 다양성이 일반화 능력을 향상시킨다는 것을 시사한다.
  • 랜덤 픽셀 값 배경이 고정된 검은 배경이나 흐린 이미지 배경보다 성능이 뛰어나며, 특히 이 조건에서 가장 높은 성공률을 기록한다.
  • LFW 얼굴 인식 벤치마크에서 ODI-MI-TI-VT는 세 대의 블랙박스 모델 평균 기준으로 도용 공격 성공률을 12.0% 향상시키고, 피하기 공격은 7.2% 향상시켰다.
  • 추가적인 초모수 조정 없이도 상당한 성능 향상을 달성하여 강력한 실용성과 강건성을 입증하였다.
  • 카메라 거리와 시점 각도의 범위가 넓어질수록 공격 성공률이 증가함을 확인하였으며, 이는 더 넓은 렌더링 다양성이 실용 범위 내에서 전이성을 향상시킨다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.