Skip to main content
QUICK REVIEW

[논문 리뷰] Fooling Vision and Language Models Despite Localization and Attention Mechanism

Xiaojun Xu, Xinyun Chen|arXiv (Cornell University)|2017. 09. 25.
Multimodal Machine Learning Applications참고 문헌 60인용 수 9
한 줄 요약

이 논문은 주의 메커니즘, 국소화, 모듈러 아키텍처를 갖춘 밀도 높은 캡셔닝 및 시각질문응답(VQA) 시스템을 포함한 시각-언어 모델이 비물리적 환경에서 목표 지향적 적대적 예측에 대해 복잡한 내부 구조를 지니고 있음에도 불구하고 여전히 높은 취약성을 보임을 입증한다. 저자들은 새로운 화이트박스 공격 방법을 사용하여 MCB 및 N2NMN와 같은 최신 모델을 90% 이상의 성공률로 속임으로써, 주의, 경계 상자 국소화, 그리고 조합적 네트워크가 비물리적 환경에서 목표 지향적 적대적 예측에 대해 효과적인 방어 수단이 되지 못함을 드러냈다.

ABSTRACT

Adversarial attacks are known to succeed on classifiers, but it has been an open question whether more complex vision systems are vulnerable. In this paper, we study adversarial examples for vision and language models, which incorporate natural language understanding and complex structures such as attention, localization, and modular architectures. In particular, we investigate attacks on a dense captioning model and on two visual question answering (VQA) models. Our evaluation shows that we can generate adversarial examples with a high success rate (i.e., > 90%) for these models. Our work sheds new light on understanding adversarial attacks on vision systems which have a language component and shows that attention, bounding box localization, and compositional internal structures are vulnerable to adversarial attacks. These observations will inform future work towards building effective defenses.

연구 동기 및 목표

  • 주목, 국소화, 모듈러 아키텍처를 갖춘 고도로 발전한 시각-언어 모델이 적대적 공격에 내성적인지 조사하기.
  • 화이트박스 조건 하에서 밀도 높은 캡셔닝 및 VQA 모델에 대한 적대적 공격의 효과성을 평가하기.
  • 언어 사전 지식과 모델 아키텍처의 조합성(compositionality)이 적대적 견고성에 영향을 미치는지 분석하기.
  • 기존 최신 기술보다 뛰어난 성능을 보이는 VQA 모델을 위한 새로운 공격 방법 개발하기.
  • 정답 빈도와 의미적 호환성의 역할이 적대적 공격 성공에 어떻게 기여하는지 이해하기.

제안 방법

  • 저자들은 기울기 기반 최적화를 활용하여 입력 이미지를 변형하는 방식으로, 시각-언어 모델을 대상으로 하는 목표 지향적 화이트박스 적대적 공격 프레임워크를 설계한다.
  • 공격는 특정 정답을 목표로 삼으며, 원하는 레이블에 대해 높은 신뢰도를 확보하면서도 눈에 띄지 않도록 최적화한다.
  • 적대적 성공률, 이미지 변형, 질문과의 의미 일관성 간 균형을 맞추기 위해 새로운 손실 함수를 도입한다.
  • 표준 및 의미 없는 질문-정답 쌍을 사용하여 MCB 및 N2NMN를 포함한 여러 모델에서 공격 성공률을 평가한다.
  • 정답 빈도와 적대적 확률 간 상관관계를 분석하여 모델의 예측 가능성과 견고성 수준을 평가한다.
  • 의미 없는 정답 타겟을 사용한 추론 분석을 통해 언어 사전 지식의 영향을 공격 성공에 고립적으로 분석한다.

실험 결과

연구 질문

  • RQ1주목 메커니즘과 영역 국소화를 사용하는 적대적 예측이 시각-언어 모델을 성공적으로 속일 수 있는가?
  • RQ2신경 모듈 네트워크(Neural Module Networks)와 같은 모듈러 아키텍처가 표준 주목 기반 모델에 비해 적대적 공격에 대해 더 높은 견고성을 제공하는가?
  • RQ3언어 사전 지식, 특히 질문과 정답 간 의미적 호환성이 적대적 공격 성공률에 어떤 영향을 미치는가?
  • RQ4정답 빈도가 적대적 공격 성공 확률과 어느 정도 상관관계를 가지는가?
  • RQ5새로운 공격 방법이 VQA 모델에 대해 기존 최신 기술보다 뛰어난 성능을 보일 수 있는가?

주요 결과

  • 제안된 공격는 MCB 및 N2NMN VQA 모델에서 모두 90% 이상의 성공률를 기록하여 복잡한 내부 구조에도 불구하고 높은 효과성을 입증한다.
  • 더 강한 언어 사전 지식을 지닌 모델, 예를 들어 N2NMN는 의미 없는 정답 타겟을 사용할 경우 MCB에 비해 약간 더 높은 저항성을 보이며, 공격 성공률가 4.6%에 그치지만 MCB는 7.8%에 이른다.
  • 정답 빈도와 적대적 확률 사이에 명확한 정적 상관관계가 존재하여 자주 예측되는 정답은 더 쉽게 공격 대상이 될 수 있음을 시사한다.
  • N2NMN 모델는 MCB에 비해 비제로 빈도를 가진 정답의 수가 적어 더 제약이 있고 의미적으로 일관된 예측 공간을 지닌 것으로 나타났다.
  • 질문과 정답이 의미적으로 호환되지 않을 경우, 적대적 공격의 실패 비율이 유의미하게 높아지며, 언어 사전 지식이 방어에 기여하는 역할을 확인한다.
  • 주목 맵, 영역 제안, 모듈러 네트워크 조합을 사용하더라도 화이트박스 환경에서는 이러한 구성 요소들이 성공적인 적대적 공격를 방지하지 못한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.