Skip to main content
QUICK REVIEW

[논문 리뷰] Order-Disorder: Imitation Adversarial Attacks for Black-box Neural Ranking Models

Jiawei Liu, Yangyang Kang|arXiv (Cornell University)|2022. 09. 14.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

이 논문은 신경 문장 랭킹 모델에 대한 블랙박스 적대적 공격을 위한 이단계적 접근을 제안한다: 첫 번째로, 쿼리-문서 삼중항에서 추출한 순서 기반 학습을 통해 타겟 모델의 랭킹 출력을 투명화하는 랭킹 모방 모델을 훈련시킨다; 두 번째로, 새로운 기울기 기반 순서 기반 앵커 기반 트리거(PAT) 생성기를 사용해 매우 이행성 있고 가림된 적대적 트리거를 생성한다. 이 방법은 미미하고 눈에 띄지 않는 변형으로 99.2%의 공격 성공률를 달성하며, 블랙박스 랭킹 시스템의 심각한 취약성을 드러낸다.

ABSTRACT

Neural text ranking models have witnessed significant advancement and are increasingly being deployed in practice. Unfortunately, they also inherit adversarial vulnerabilities of general neural models, which have been detected but remain underexplored by prior studies. Moreover, the inherit adversarial vulnerabilities might be leveraged by blackhat SEO to defeat better-protected search engines. In this study, we propose an imitation adversarial attack on black-box neural passage ranking models. We first show that the target passage ranking model can be transparentized and imitated by enumerating critical queries/candidates and then train a ranking imitation model. Leveraging the ranking imitation model, we can elaborately manipulate the ranking results and transfer the manipulation attack to the target ranking model. For this purpose, we propose an innovative gradient-based attack method, empowered by the pairwise objective function, to generate adversarial triggers, which causes premeditated disorderliness with very few tokens. To equip the trigger camouflages, we add the next sentence prediction loss and the language model fluency constraint to the objective function. Experimental results on passage ranking demonstrate the effectiveness of the ranking imitation attack model and adversarial triggers against various SOTA neural ranking models. Furthermore, various mitigation analyses and human evaluation show the effectiveness of camouflages when facing potential mitigation approaches. To motivate other scholars to further investigate this novel and important problem, we make the experiment data and code publicly available.

연구 동기 및 목표

  • 블랙박스 신경 문장 랭킹 모델이 모델 투명도가 제한된 상황에서도 적대적 공격에 얼마나 취약한지 조사하기 위해.
  • 타겟 모델에 화이트박스 액세스가 필요 없는 이행성 있는 적대적 공격 방법을 개발하기 위해.
  • 유창성과 의미 일관성 제약 조건을 통합하여 효과적이면서도 눈에 띄지 않는 적대적 트리거를 생성하기 위해.
  • 예방 조치와 인간 인식에 대한 공격의 강건성 평가하기 위해.
  • 향후 신경 랭킹 시스템의 방어 메커니즘에 대한 연구를 장려하기 위해 코드와 데이터를 공개하기 위해.

제안 방법

  • 타겟 모델의 랭킹 목록에서 추출한 쿼리-양성 후보-음성 후보 삼중항을 사용하여, 관련성 점수를 요구하지 않고 순서 기반 BERT 랭커를 사용해 랭킹 모방 모델을 훈련시킨다.
  • 모방 모델의 기울기를 활용하여 순서 기반 목적 함수를 통해 랭킹 순서를 조작하는 적대적 트리거 생성을 유도한다.
  • 각 후보 문서에 맞게 트리거를 최적화하여 순서를 극대화하는 데 초점을 맞춘 순서 기반 앵커 기반 트리거(PAT) 생성기를 설계한다.
  • 의미 일관성과 자연스러움을 확보하기 위해 목적 함수에 다음 문장 예측 손실과 언어 모델 유창성 제약 조건을 통합한다.
  • 생성된 트리거를 문서 텍스트의 시작부분, 중간, 또는 끝부분에 삽입하고, 원본 블랙박스 모델로의 이행성 평가를 수행한다.
  • 인간 평가와 예방 분석을 통해 트리거의 눈에 띄지 않는 정도와 방어 조치에 대한 강건성을 검증한다.

실험 결과

연구 질문

  • RQ1타겟 모델의 랭킹 출력만을 사용하여 랭킹 모방 모델을 통해 블랙박스 신경 문장 랭킹 모델을 효과적으로 역설계할 수 있는가?
  • RQ2제안된 PAT 트리거 생성기가 최소한의 눈에 띄는 변화로 타겟 모델에 적대적 변형을 효과적으로 이행할 수 있는가?
  • RQ3유창성과 의미 일관성 제약 조건이 적대적 트리거의 가림 효과를 어느 정도 향상시키는가?
  • RQ4트리거 위치(시작, 중간, 끝)가 공격 성공률와 눈에 띄지 않는 정도에 어떤 영향을 미치는가?
  • RQ5입력 자르기나 적대적 훈련과 같은 예방 전략이 적용된 상황에서도 제안된 공격이 여전히 효과적인가?

주요 결과

  • 랭킹 모방 모델은 TREC DL 2019에서 89.9 MRR@10을 달성하여 타겟 모델의 90.1에 매우 가까운 성능을 보이며 강력한 이행성을 입증한다.
  • PAT 기반 공격는 트리거를 문서 끝부분에 삽입했을 때 99.2%의 공격 성공률를 기록했으며, 관련성이 없는 17.2%의 문서가 상위 100개 내에 랭크되었다.
  • 유창성과 일관성 제약 조건을 통합해 생성된 트리거는 인간 평가를 통해 훨씬 더 자연스럽고 탐지하기 어려운 것으로 확인되었다.
  • 언어 모델 유창성 또는 다음 문장 예측 손실을 제거해도 공격 성능은 다소 떨어지지만 여전히 효과적으로 작동한다.
  • 특히 트리거를 문서 끝부분에 삽입했을 때, 공격 성공률와 트리거의 눈에 띄지 않는 정도에서 베이스라인을 능가한다.
  • 인간 평가를 통해 PAT로 생성된 트리거는 베이스라인 대비 더 유창하고 의미적으로 일관되며, 가림 효과를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.