Skip to main content
QUICK REVIEW

[논문 리뷰] Fooling Explanations in Text Classifiers

Adam Ivankay, I. Girardi|arXiv (Cornell University)|2022. 06. 07.
Explainable Artificial Intelligence (XAI)인용 수 5
한 줄 요약

이 논문은 여러 NLP 모델과 데이터셋에서 원래 분류기 예측을 유지하면서 설명 출력(예: 통합 기울기로부터 유도된 중요도 맵 등)을 극적으로 변화시키는, 눈에 띄지 않는 텍스트 변형을 생성하는 블랙박스 적대적 공격인 TEXTEXTPLANATIONFOOLER(TEF)을 소개한다. 주요 기여는 텍스트 분류기의 설명이 매우 취약하다는 것을 입증한 것으로, TEF는 일부 케이스에서 설명의 할당 상관관계를 최대 0.75까지 감소시키며, 모델에 대한 액세스 없이도 작동하는 반만 유니버설 공격 설정에서도 성능을 유지한다.

ABSTRACT

State-of-the-art text classification models are becoming increasingly reliant on deep neural networks (DNNs). Due to their black-box nature, faithful and robust explanation methods need to accompany classifiers for deployment in real-life scenarios. However, it has been shown in vision applications that explanation methods are susceptible to local, imperceptible perturbations that can significantly alter the explanations without changing the predicted classes. We show here that the existence of such perturbations extends to text classifiers as well. Specifically, we introduceTextExplanationFooler (TEF), a novel explanation attack algorithm that alters text input samples imperceptibly so that the outcome of widely-used explanation methods changes considerably while leaving classifier predictions unchanged. We evaluate the performance of the attribution robustness estimation performance in TEF on five sequence classification datasets, utilizing three DNN architectures and three transformer architectures for each dataset. TEF can significantly decrease the correlation between unchanged and perturbed input attributions, which shows that all models and explanation methods are susceptible to TEF perturbations. Moreover, we evaluate how the perturbations transfer to other model architectures and attribution methods, and show that TEF perturbations are also effective in scenarios where the target model and explanation method are unknown. Finally, we introduce a semi-universal attack that is able to compute fast, computationally light perturbations with no knowledge of the attacked classifier nor explanation method. Overall, our work shows that explanations in text classifiers are very fragile and users need to carefully address their robustness before relying on them in critical applications.

연구 동기 및 목표

  • 작은, 눈에 띄지 않는 입력 변형에 의해 텍스트 분류기의 설명 방법이 얼마나 취약한지 폭 드러내는 것.
  • 분류기 예측를 변경하지 않으면서 설명 출력을 조작하는 블랙박스 공격인 TEXTEXTPLANATIONFOOLER(TEF)를 개발하는 것.
  • 다양한 데이터셋, 모델, 설명 기법에 걸쳐 할당 방법의 강건성 평가하는 것.
  • TEF 변형이 알려지지 않은 모델과 설명 방법 간에 이동 가능한지 확인하는 것.
  • 모델에 대한 액세스 없이도 공격 시점에 쿼리를 사용하지 않고 설명을 조작할 수 있는 반만 유니버설 공격 정책을 도입하는 것.

제안 방법

  • TEF는 분류기 신뢰도를 유지하면서 할당 상관관계를 최소화하는 단어 치환을 최적화함으로써 설명 방법을 공격하는 블랙박스 적대적 공격를 수립한다.
  • 공격는 동의어 교체와 임베딩 유사도 기반의 기울기 없는 최적화 전략을 사용하여 눈에 띄지 않는 변형을 생성한다.
  • 각 입력에 대해 TEF는 원본 및 변형된 할당 맵 간 피어슨 상관계수(PCC)의 감소를 최대화하는 변형을 계산한다.
  • 반만 유니버설 공격 정책은 데이터셋 하위 집합에서 TEF 최적화 변형의 빈도 높은 교체를 집계하여 구성되며, 사전에 계산된 빠른 공격을 가능하게 한다.
  • 강건성 평가에는 원본 및 변형된 할당 간 PCC를 사용하며, 낮은 값일수록 설명의 취약성이 높음을 의미한다.
  • 실험은 세 개의 DNN 및 세 개의 트랜스포머 아키텍처를 사용한 다섯 개의 텍스트 분류 데이터셋에서 수행되었으며, 세 가지 설명 방법(예: 통합 기울기)을 적용하였다.

실험 결과

연구 질문

  • RQ1눈에 띄지 않는 텍스트 변형이 분류기 예측을 유지하면서도 설명 출력을 크게 변화시킬 수 있는가?
  • RQ2이러한 공격 하에서 다양한 모델과 데이터셋에서 서로 다른 설명 방법의 강건성은 어떠한가?
  • RQ3TEF 변형은 알려지지 않은 모델과 설명 방법으로 얼마나 효과적으로 이동 가능한가?
  • RQ4공격 시점에 타깃 모델을 쿼리하지 않고도 설명을 조작할 수 있는 반만 유니버설 공격 정책을 구성할 수 있는가?
  • RQ5TEF 공격는 랜덤 공격나 기준선 공격에 비해 할당 강건성 저하 정도가 어느 정도인가?

주요 결과

  • TEF는 할당 상관관계를 크게 감소시키며, 여러 설정에서 PCC가 0.2 이하로 떨어지며 설명을 왜곡하는 데 높은 효과를 보였다.
  • 평균적으로 TEF는 원본 할당 대비 PCC를 최대 0.75까지 감소시켰으며, 이는 모든 테스트된 모델과 데이터셋에서 설명이 매우 취약하다는 것을 보여준다.
  • 공격는 알려지지 않은 모델과 설명 방법으로 효과적으로 이동 가능하여, NLP 설명 영역 전반에 걸친 광범위한 취약성을 시사한다.
  • 반만 유니버설 공격 정책은 모델 쿼리를 전혀 사용하지 않아도 TEF와 유사한 성능을 달성하여 실용성과 강건성을 입증한다.
  • 랜덤 공격 기준선은 TEF에 비해 유의미하게 열등한 성능을 보였으며, 관찰된 저하가 랜덤 노이즈가 아니라 타겟된 변형 때문임을 확인한다.
  • 모든 다섯 개의 데이터셋(AG’s News, IMDB, MR, Rotten Tomatoes, Yelp)에서 TEF는 할당 정밀도를 일관되게 떨어뜨려 현재의 설명 방법에 내재된 체계적 취약성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.