Skip to main content
QUICK REVIEW

[논문 리뷰] BERT Rankers are Brittle: a Study using Adversarial Document Perturbations

Yumeng Wang, Lijun Lyu|arXiv (Cornell University)|2022. 06. 23.
Sentiment Analysis and Opinion Mining인용 수 4
한 줄 요약

이 논문은 BERT 기반 랭킹 모델에 대해 문서 텍스트를 미세 조정하여 최소한의 토큰 변경으로도 문서 순위를 극적으로 이동시키는 화이트박스 적대적 공격을 제안한다. 기울기 기반 최적화를 사용하여 저자들은 단지 5개의 적대적 토큰—특히 문서 시작 부분에 위치할 경우—를 추가함으로써 큰 순위 하락이나 상승을 유도할 수 있음을 입증한다. 이는 모델의 취약성과 사전학습 및 데이터셋으로 인한 주제별 편향을 드러낸다.

ABSTRACT

Contextual ranking models based on BERT are now well established for a wide range of passage and document ranking tasks. However, the robustness of BERT-based ranking models under adversarial inputs is under-explored. In this paper, we argue that BERT-rankers are not immune to adversarial attacks targeting retrieved documents given a query. Firstly, we propose algorithms for adversarial perturbation of both highly relevant and non-relevant documents using gradient-based optimization methods. The aim of our algorithms is to add/replace a small number of tokens to a highly relevant or non-relevant document to cause a large rank demotion or promotion. Our experiments show that a small number of tokens can already result in a large change in the rank of a document. Moreover, we find that BERT-rankers heavily rely on the document start/head for relevance prediction, making the initial part of the document more susceptible to adversarial attacks. More interestingly, we find a small set of recurring adversarial words that when added to documents result in successful rank demotion/promotion of any relevant/non-relevant document respectively. Finally, our adversarial tokens also show particular topic preferences within and across datasets, exposing potential biases from BERT pre-training or downstream datasets.

연구 동기 및 목표

  • 적대적 문서 편집에 대한 BERT 기반 랭킹 모델의 내구성 조사
  • 유의미한 관련 문서를 강등하거나 관련성이 낮은 문서를 상위로 올리는 데 사용할 수 있는 기울기 기반 공격 방법 개발
  • 다양한 쿼리 및 데이터셋 간 적대적 토큰의 재현성과 주제 선호도 분석
  • 사전학습 또는 후행 랭킹 데이터셋으로 인해 발생할 수 있는 BERT 랭킹 모델 내 잠재적 편향 규명

제안 방법

  • 문서 텍스트의 고기울기 위치에서 적대적 토큰을 식별하기 위해 기울기 기반 토큰 검색을 사용하는 국소 랭킹 공격 제안
  • 개별 쿼리가 아닌 전체 쿼리 워크로드를 기준으로 순위 이동을 최적화하는 글로벌 랭킹 공격 설계
  • NLP 적대적 공격에서의 기울기 기반 최적화 기법(예: Ebrahimi 등, 2017; Wallace 등, 2019a)을 문서 랭킹 설정에 적응 적용
  • 공격 효과를 평가하기 위해 ClueWeb09 및 TREC-DL 데이터셋에 피팅된 BERT 스타일 랭커를 피해 모델로 사용
  • PCA 시각화 및 주제 빈도 분석을 통한 후행 분석을 통해 적대적 토큰의 반복 주제 탐지
  • 문서 시작 영역에 집중하여 랭킹 강등(높은 관련성 문서)과 랭킹 상승(낮은 순위 문서)에 대한 공격을 평가

실험 결과

연구 질문

  • RQ1소규모이고 목표가 정확한 문서 텍스트 편집이 BERT 기반 랭킹 모델에서 상당한 순위 이동을 유도할 수 있는가?
  • RQ2주의 메커니즘 또는 주의 패턴으로 인해 BERT 랭커가 문서 시작 부분에서 적대적 공격에 더 취약한가?
  • RQ3적대적 토큰이 다양한 쿼리 및 데이터셋 간에 반복되며, 만약 그렇다면 어떤 주제를 나타내는가?
  • RQ4반복되는 적대적 토큰이 어느 정도 BERT의 사전학습 또는 후행 랭킹 데이터셋의 편향을 반영하는가?
  • RQ5국소 공격 전략과 글로벌 공격 전략 간 적대적 토큰의 빈도 및 주제 분포는 어떻게 비교되는가?

주요 결과

  • 국소 랭킹 공격에서 단지 5개의 적대적 토큰만 사용해도 ClueWeb09의 상위 랭킹 문서 평균 순위가 83개 순위 하락했다.
  • 글로벌 공격는 동일한 5개의 빈도가 가장 높은 적대적 토큰을 사용하여 평균 79개 순위 하락을 달성했다.
  • 적대적 토큰은 쿼리 및 데이터셋 간에 자주 반복되었으며, 자연, 종교, 민족, 의학 관련 용어에 강한 주제 선호를 보였다.
  • 순위 강등에 가장 자주 사용된 적대적 토큰은 'acceptable', 'competition', 'rayon'이었고, 순위 상승에 사용된 것은 'tornadoes', 'hurricanes', 'earthquakes'였다.
  • BERT 랭커는 문서 시작 부분의 편집에 특히 민감하여 관련성 예측에 초기 토큰에 강하게 의존하고 있음을 시사했다.
  • 반복되는 적대적 토큰은 코퍼스에서 흔하지 않으며 관련성 레이블과 낮은 상호정보량을 보였으므로, 이는 의미적 관련성보다 모델의 편향을 악용하는 데서 비롯된 것으로 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.