Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Evaluation of Multimodal Models under Realistic Gray Box Assumption

Ivan Evtimov, Russel Howes|arXiv (Cornell University)|2020. 11. 25.
Hate Speech and Cyberbullying Detection인용 수 5
한 줄 요약

이 논문은 다중모달(이미지+텍스트) 분류기에서의 적대적 강건성 평가를 위한 현실적인 그레이박스 위협 모델을 제안하며, 모델 구성 요소에 대한 부분적 지식을 악용하는 이중모달 공격을 제안한다. 이는 이미지 및 텍스트 공격을 병합한 경우 73%까지 잘못 분류되는 결과를 보였으며, 단일모달 공격을 뛰어넘었고, 이미지 전용 공격은 문자 수준의 텍스트 증강보다 더 효과적이었다(에러율 45% 대 30%).

ABSTRACT

This work examines the vulnerability of multimodal (image + text) models to adversarial threats similar to those discussed in previous literature on unimodal (image- or text-only) models. We introduce realistic assumptions of partial model knowledge and access, and discuss how these assumptions differ from the standard "black-box"/"white-box" dichotomy common in current literature on adversarial attacks. Working under various levels of these "gray-box" assumptions, we develop new attack methodologies unique to multimodal classification and evaluate them on the Hateful Memes Challenge classification task. We find that attacking multiple modalities yields stronger attacks than unimodal attacks alone (inducing errors in up to 73% of cases), and that the unimodal image attacks on multimodal classifiers we explored were stronger than character-based text augmentation attacks (inducing errors on average in 45% and 30% of cases, respectively).

연구 동기 및 목표

  • 완전한 화이트박스 또는_BLK-박스 접근 방식 사이의 현실적인 위협 모델에서 다중모달 분류기의 적대적 취약성을 조사하기 위해.
  • 이미지 및 텍스트 모달 모두에 적대적 편향이 가해졌을 때 다중모달 모델이 단일모달 모델보다 더 강건한가를 평가하기 위해.
  • 모델 접근 및 지식 수준이 다양한 조건에서 이미지 기반 및 텍스트 기반 적대적 공격의 효과성을 평가하기 위해.
  • 예를 들어 사전 학습된 객체 검출기와 같은 공개적, 즉시 사용 가능한 구성 요소의 사용이 다중모달 시스템의 적대적 취약성에 어떤 영향을 미치는지 조사하기 위해.
  • 가장자기 기반, 무작위 탐색, 전이 기반 공격과 같은 다양한 적대적 공격 전략이 다중모달 분류 성능에 미치는 영향을 정량화하기 위해.

제안 방법

  • 특성 추출기나 Faster R-CNN 및 ResNet과 같은 즉시 사용 가능한 모델과 같은 일부 모델 구성 요소에 대한 부분적 접근을 가정하는 그레이박스 공격 프레임워크를 개발함.
  • 적대적 이미지를 생성하기 위해 $ L = ||f(x) - f(y)||_2 $ 형태의 특성 매칭 손실 함수를 사용하여, 동일한 텍스트를 가진 반대 레이블의 대상 이미지로 특성 맵을 이동함.
  • 다양한 모델들(예: ResNet-152, DenseNet 등)에 대한 앙상블 평균을 적용한 PGD 기반 최적화를 통해 블랙박스 및 그레이박스 환경에서의 공격 전이성 향상.
  • 편집 거리 제약 조건을 적용한 범위 탐색을 통해 의미적 이탈을 최소화하면서도 정답 클래스의 신뢰도를 최대한 낮추는 적대적 텍스트 증강을 구현함.
  • 편집 거리 임계값(τ = 0.07, 0.2, 0.5)을 기반으로 경미, 중간, 심한 수준의 텍스트 공격 세 가지 수준을 정의하여 편집 정도를 제어함.
  • 직접 접근이 불가능할 경우 외부 모델을 활용하여 텍스트 공격 순위를 매기기 위해 화이트박스 및 경미한 그레이박스 설정을 사용함.

실험 결과

연구 질문

  • RQ1표준 블랙박스 또는 화이트박스 모델과 비교해 현실적인 그레이박스 가정 하에서 다중모달 분류기의 강건성은 어떻게 변하는가?
  • RQ2이미지 및 텍스트 모달에 동시에 적대적 공격을 가했을 때 단일모달 공격보다 얼마나 더 잘 잘못 분류를 유도하는가?
  • RQ3다중모달 분류기를 속이기 위해 이미지 기반 적대적 공격이 문자 수준의 텍스트 증강 공격보다 얼마나 더 효과적인가?
  • RQ4예를 들어 객체 검출기와 같은 공개적 사전 학습된 구성 요소의 사용이 다중모달 모델의 적대적 공격에 대한 취약성을 증가시키는가?
  • RQ5동일한 위협 모델 하에서 다중모달 융합 기법의 선택이 적대적 강건성에 어떤 영향을 미치는가?

주요 결과

  • 이미지 및 텍스트 모달에 동시에 적대적 공격을 가한 결과, Hateful Memes 데이터셋에서 다중모달 분류기의 성공률이 최대 73%에 달함.
  • 이미지 전용 공격은 45%의 케이스에서 잘못 분류를 유도하였고, 문자 기반 텍스트 증강 공격보다 더 효과적이었으며, 이는 30%의 에러율을 기록함.
  • 다양한 융합 기법을 사용한 다중모달 모델들이 유사한 취약성을 보였으며, 이는 융합 전략이 강건성에 크게 영향을 주지 않음을 시사함.
  • 사전 학습된, 미세조정되지 않은 객체 검출기를 사용하는 모델들은 적대적 공격에 취약했으며, 이는 공개적으로 이용 가능한 구성 요소가 약한 공격자도 효과적인 공격을 수행할 수 있음을 보여줌.
  • 적대적 공격의 성공 여부는 구체적인 융합 기법에 의존하지 않았으며, 이는 강건성을 아키텍처 선택 외에도 입력 수준에서 해결해야 함을 시사함.
  • 가장자기 기반 범위 탐색은 특히 경미 및 중간 수준의 편집에서 무작위 탐색보다 더 높은 성공률을 기록함으로써, 그레이박스 환경에서 질의 기반 탐색의 가치를 확인함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.