[논문 리뷰] Exact Adversarial Attack to Image Captioning via Structured Output Learning with Latent Variables
이 논문은 잠재 변수를 활용한 구조적 출력 학습으로 공식화된, 부분적 캡션(캡션의 일부 단어만 지정됨)을 대상으로 하는 첫 번째 정확한 적대적 공격 프레임워크를 제안한다. 일반화된 기대 최대화(GEM)와 잠재 변수를 갖는 구조적 서포트 벡터 머신(Structural SVMs)을 사용하여, 인간이 인지하기 어려운 정도의 적대적 노이즈를 생성함으로써 최첨단 CNN+RNN 모델이 목표로 한, 종종 관련성이 없는 캡션을 생성하도록 유도한다. 이는 인간 캡션과 비교해 볼 때 모델의 언어적 및 구조적 이해 능력에 심각한 격차가 있음을 드러낸다.
In this work, we study the robustness of a CNN+RNN based image captioning system being subjected to adversarial noises. We propose to fool an image captioning system to generate some targeted partial captions for an image polluted by adversarial noises, even the targeted captions are totally irrelevant to the image content. A partial caption indicates that the words at some locations in this caption are observed, while words at other locations are not restricted.It is the first work to study exact adversarial attacks of targeted partial captions. Due to the sequential dependencies among words in a caption, we formulate the generation of adversarial noises for targeted partial captions as a structured output learning problem with latent variables. Both the generalized expectation maximization algorithm and structural SVMs with latent variables are then adopted to optimize the problem. The proposed methods generate very successful at-tacks to three popular CNN+RNN based image captioning models. Furthermore, the proposed attack methods are used to understand the inner mechanism of image captioning systems, providing the guidance to further improve automatic image captioning systems towards human captioning.
연구 동기 및 목표
- CNN+RNN 기반 이미지 캡션 모델이 부분 캡션에 대해 타겟된 적대적 공격에 얼마나 강건한지 조사하기 위해.
- 특정 위치에 지정된 단어 시퀀스를 강제로 생성하면서도 자연어의 구조를 유지하는 적대적 노이즈를 생성하는 데 도전하기 위해.
- 기울기 기반 방법에 쉽게 적용되지 않는 구조적 출력에 대한 정확한 공격을 위한 체계적인 프레임워크를 개발하기 위해.
- 공격 방법을 탐색 도구로 활용하여 이미지 캡션 모델의 내부 메커니즘을 분석하고 이해하기 위해.
- 현재 모델이 수동태나 관형어절과 같은 다양한 언어 스타일을 생성하는 데에 얼마나 능숙한지에 대한 제한을 드러내기 위해.
제안 방법
- 목표로 한 부분 캡션 공격을 잠재 변수로 간주하는 구조적 출력 학습 문제로 공식화하며, 관측되지 않은 단어는 잠재 변수로 간주한다.
- 목표로 한 부분 캡션의 로그 주변 가능도를 최대화하기 위해 일반화된 기대 최대화(GEM) 알고리즘을 사용한다.
- 목표 캡션과 동일한 위치에 있는 모든 다른 가능한 캡션과의 마진을 최대화하기 위해 잠재 변수를 갖는 구조적 서포트 벡터 머신을 적용한다.
- 목표 캡션의 가능도 또는 마진을 최대화하면서 L2 노름을 최소화하는 적대적 노이즈를 최적화한다.
- 이 프레임워크는 아키텍처에 종속되지 않으며, 어떤 CNN+RNN 기반 이미지 캡션 모델에도 적용 가능하다.
- 비타겟 공격을 위해 투영된 경량 하강법을 사용하여 다양한 공격 유형에서의 모델 행동을 비교한다.
실험 결과
연구 질문
- RQ1CNN+RNN 기반 이미지 캡션 모델이 이미지와 의미적으로 관련이 없더라도 특정 부분 캡션을 생성하도록 유도할 수 있는 적대적 노이즈를 생성할 수 있는가?
- RQ2잠재 변수를 활용한 구조적 출력 학습 프레임워크는 캡션과 같은 순차적이고 구조적인 출력에 대해 정확한 공격을 어떻게 가능하게 하는가?
- RQ3현재 이미지 캡션 모델이 적대적 조건 하에서 수동태나 관형어절과 같은 다양한 언어적 구조를 얼마나 잘 생성할 수 있는가?
- RQ4공격의 성공 및 실패 패턴은 딥 러닝 모델이 이미지 캡션에서 언어적 및 구성적 이해 능력에 대해 무엇을 드러내는가?
- RQ5비타겟 공격과 타겟 공격는 의미적 일관성과 문법적 타당성 측면에서 어떻게 비교되는가?
주요 결과
- 제안된 GEM 및 잠재 변수를 갖는 SSVM 방법은 Show-And-Tell, Show-Attend-And-Tell, SCST의 세 개의 최첨단 이미지 캡션 모델에 대해 성공적으로 적대적 공격를 수행했다.
- 적대적 노이즈의 평균 L2 노름은 GEM 기반으로 1.5202에 불과하여 인간 관찰자에게 인지되지 않을 정도로 미미했다.
- 공격 성공률(SR)은 GEM 기반으로 65.86%에 도달했으며, SR 및 정밀도(0.8009 대비 0.7239) 측면에서 Show-and-Fool을 크게 능가했다.
- 단지 Show-Attend-and-Tell 모델만 공격 하에서 수동태 문장을 생성할 수 있었고, 모든 모델가 관형어절을 생성하지 못해 언어적 유연성이 제한됨을 보여주었다.
- 비타겟 공격는 문법적으로 잘못된, 의미 없는 캡션을 생성했으며, 이는 현재 모델들이 자연어의 기본 문법을 학습하지 못하고 있음을 시사한다.
- 공격 프레임워크는 현재 모델들이 언어 다양성과 구조적 이해 측면에서 인간 수준의 캡션 생성 능력과는 거리가 멀다는 것을 효과적으로 드러냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.