Skip to main content
QUICK REVIEW

[논문 리뷰] Attacking Visual Language Grounding with Adversarial Examples: A Case Study on Neural Image Captioning

Hongge Chen, Huan Zhang|arXiv (Cornell University)|2017. 12. 06.
Multimodal Machine Learning Applications참고 문헌 49인용 수 20
한 줄 요약

이 논문은 특정 캡션 또는 키워드를 겨냥하여 신경망 이미지 캡션 모델에 악성 예측을 유도하는 최적화 기반의 새로운 방법인 Show-and-Fool을 제안한다. 이 방법은 시각적으로 인식하기 어려운 변형을 생성하여 최신 캡션 모델을 오도하는 데 높은 성공률을 달성하며, 시각-언어 기반 시스템의 심각한 취약성을 드러낸다.

ABSTRACT

Visual language grounding is widely studied in modern neural image captioning systems, which typically adopts an encoder-decoder framework consisting of two principal components: a convolutional neural network (CNN) for image feature extraction and a recurrent neural network (RNN) for language caption generation. To study the robustness of language grounding to adversarial perturbations in machine vision and perception, we propose Show-and-Fool, a novel algorithm for crafting adversarial examples in neural image captioning. The proposed algorithm provides two evaluation approaches, which check whether neural image captioning systems can be mislead to output some randomly chosen captions or keywords. Our extensive experiments show that our algorithm can successfully craft visually-similar adversarial examples with randomly targeted captions or keywords, and the adversarial examples can be made highly transferable to other image captioning systems. Consequently, our approach leads to new robustness implications of neural image captioning and novel insights in visual language grounding.

연구 동기 및 목표

  • 이미지 분류보다 더 복잡한 개방형 자연어 출력을 고려할 때, 신경망 이미지 캡션 모델이 악성 변형에 얼마나 취약한지 조사하는 것.
  • 이미지 분류의 이산 클래스 레이블과 달리, 매우 넓고 의미적으로 미묘한 출력 공간을 고려해 타겟된 악성 예측을 생성하는 데 도전하는 것.
  • 시각-언어 기반에 사용되는 CNN+RNN 아키텍처에 대해 일반화된 최적화 기반 프레임워크를 개발하는 것.
  • 다양한 이미지 캡션 모델 간에 악성 예측의 이식 가능성(transferability)을 평가하여 현재 아키텍처에 공통된 취약점을 드러내는 것.

제안 방법

  • 악성 예측 생성을 제약 조건이 있는 최적화 문제로 공식화하고 복합 손실 함수를 사용하는 최적화 기반 알고리즘인 Show-and-Fool을 제안한다.
  • 시각적 흐리기(예: ℓ∞ 노름)와 작업에 특화된 손실 함수의 선형 조합을 사용하여, 인식하기 어려움과 공격 효과성 사이의 균형을 맞춘다.
  • 두 가지 별도의 공격 모드를 사용한다: 타겟 캡션 공격(특정 캡션을 강제로 유도)과 타겟 키워드 공격(특정 키워드가 캡션에 포함되도록 보장).
  • 키워드 공격의 경우, 손실 함수는 생성된 캡션에 지정된 키워드가 존재하기만 하면 되며, 모델이 자연스러운 문장으로 둘러싸도록 허용한다.
  • 기울기 기반 최적화를 활용하여, 타겟 캡션 또는 키워드 존재 확률을 최대화하는 소규모 시각적 인식이 어려운 변형을 생성한다.
  • Show-and-Tell, Show-Attend-and-Tell, NeuralTalk 등의 모델을 사용하여 MSCOCO 데이터셋에서 방법을 검증하였으며, 다양한 모델 간 이식 가능성을 입증하였다.

실험 결과

연구 질문

  • RQ1특정 타겟 캡션을 유도하기 위해 신경망 이미지 캡션에서 효과적으로 악성 예측를 생성할 수 있는가?
  • RQ2모델이 문장을 자유롭게 구성할 수 있도록 허용하더라도, 특정 키워드가 캡션에 포함되도록 악성 예측를 생성할 수 있는가?
  • RQ3유사한 CNN+RNN 아키텍처를 사용하는 다양한 이미지 캡션 모델 간에 악성 예측의 이식 가능성은 어느 정도인가?
  • RQ4무한하고 의미적으로 풍부한 출력 공간을 고려할 때, 이미지 분류보다 이미지 캡션 공격이 본질적으로 더 어렵다고 볼 수 있는가?
  • RQ5악성 변형이 인간의 시각적 인지와 기계의 이해 간의 일관성 결여를 어느 정도 드러내는가?

주요 결과

  • Show-and-Fool는 여러 최신 이미지 캡션 모델에서 타겟 캡션 공격 시 90% 이상, 타겟 키워드 공격 시 85% 이상의 높은 공격 성공률를 달성한다.
  • Show-and-Fool가 생성한 악성 예측는 시각적으로 인식하기 어려우며, ℓ∞ 변형이 최소 0.01에 불과하며 원본 이미지와 높은 의미적 유사성을 유지한다.
  • 악성 예측는 강력한 이식 가능성을 보이며, 다른 이미지 캡션 모델(예: Show-Attend-and-Tell, NeuralTalk)을 성공적으로 속일 수 있다. 이는 학습 데이터 분할이 다를 경우에도 성립한다.
  • 표준 이미지 분류 공격(I-FGSM 및 C&W)과 비교했을 때, 캡션 모델에 대한 공격 성공률는 각각 34.5%와 22.4%에 그쳤으며, 더 큰 변형을 사용한 경우에도 마찬가지였다. 이는 캡션 공격의 본질적 어려움을 확인한다.
  • 결과는 시각-언어 기반의 근본적인 불일치를 드러낸다: 모델은 시각적 유사성을 유지하면서도 의미적으로 잘못된 캡션을 생성하도록 유도될 수 있으며, 이는 다중모odal AI 시스템의 심각한 취약성을 폭 드러낸다.
  • 본 연구는 현재의 이미지 캡션 모델이 미세하고 인식하기 어려운 변형에 취약하다는 점을 입증하며, 악성 훈련 또는 아키텍처 재설계를 통한 강건성 향상이 필요하다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.