Skip to main content
QUICK REVIEW

[논문 리뷰] Topic-oriented Adversarial Attacks against Black-box Neural Ranking Models

Yuan Liu, Ruqing Zhang|arXiv (Cornell University)|2023. 04. 28.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 블랙박스 신경 순위 매기기 모델을 대상으로 한 새로운 주제 중심의 적대적 공격 프레임워크인 TARA를 제안한다. 이 프레임워크는 서rogate 모델을 사용한 강화학습을 통해 의미를 유지하는 변형을 생성하여, 동일 주제의 여러 쿼리에서 대상 문서의 순위를 향상시킨다. 이 방법은 기존의 공격들보다 뚜렷이 뛰어나며, 블랙박스 환경에서 MS MARCO에서 평균 순위 향상도 18.3 vs. 31.6을 기록한다.

ABSTRACT

Neural ranking models (NRMs) have attracted considerable attention in information retrieval. Unfortunately, NRMs may inherit the adversarial vulnerabilities of general neural networks, which might be leveraged by black-hat search engine optimization practitioners. Recently, adversarial attacks against NRMs have been explored in the paired attack setting, generating an adversarial perturbation to a target document for a specific query. In this paper, we focus on a more general type of perturbation and introduce the topic-oriented adversarial ranking attack task against NRMs, which aims to find an imperceptible perturbation that can promote a target document in ranking for a group of queries with the same topic. We define both static and dynamic settings for the task and focus on decision-based black-box attacks. We propose a novel framework to improve topic-oriented attack performance based on a surrogate ranking model. The attack problem is formalized as a Markov decision process (MDP) and addressed using reinforcement learning. Specifically, a topic-oriented reward function guides the policy to find a successful adversarial example that can be promoted in rankings to as many queries as possible in a group. Experimental results demonstrate that the proposed framework can significantly outperform existing attack strategies, and we conclude by re-iterating that there exist potential risks for applying NRMs in the real world.

연구 동기 및 목표

  • 단일 쿼리 쌍을 넘는 신경 순위 매기기 모델을 대상으로 한 적대적 공격의 격차를 메우기 위해, 더 현실적인 주제 중심의 공격 시나리오를 도입한다.
  • 모델의 기울기 정보 없이 하드 레이블 피드백만을 사용하는 의사결정 기반 블랙박스 공격 프레임워크를 개발한다.
  • 주제 인식 보상에 의해 이끌리는 마르코프 결정 과정(MDP)으로 공격를 모델링하여 공격의 효과를 향상시킨다.
  • 정적 및 동적 설정을 평가하여, 모델이 시간이 지남에 따라 업데이트될 수 있는 실제 운영 환경을 시뮬레이션한다.
  • 일반적인, 주제 전체에 걸쳐 적용되는 변형이 비록 눈에 띄지 않지만 매우 효과적인 방식으로 신경 순위 매기기 모델의 취약성을 입증한다.

제안 방법

  • 공격를 주제 중심의 마르코프 결정 과정(MDP)으로 공식화하여, 에이전트가 쿼리 그룹 전반에서 순위 향상을 극대화하는 변형을 학습하도록 한다.
  • 정책 네트워크의 강화학습 과정을 안내하기 위해 타겟 모델의 행동을 시뮬레이션하는 서rogate 순위 매기기 모델을 사용한다.
  • 주제 중심의 보상 함수를 설계하여, 동일 주제 그룹 내 가능한 한 많은 쿼리에서 대상 문서의 순위를 향상시키도록 유도한다.
  • 정책 그래ient 방법(PPO 등)을 사용하여 공격 정책을 최적화하고, 트리거 삽입 또는 단어 치환을 통해 변형을 적용한다.
  • 정적 및 동적 설정을 모두 지원한다: 동적 모드에서는 새로운 피드백를 사용해 정책을 재학습함으로써 모델 업데이트에 적응한다.
  • 문서의 다양한 위치(시작, 중간, 끝)에 트리거를 삽입하고, 교체할 단어의 수를 다양화하여 효과성과 눈에 띄지 않음 사이의 트레이드오프를 연구한다.

실험 결과

연구 질문

  • RQ1동일 주제를 공유하는 쿼리 그룹 전반에서 대상 문서를 향상시키기 위해, 단일 쿼리가 아닌 주제 중심의 적대적 변형을 설계할 수 있는가?
  • RQ2의사결정 기반 블랙박스 환경에서 강화학습 기반 접근법이 이러한 주제 전반의 적대적 예제를 생성하는 데 얼마나 효과적인가?
  • RQ3내부 파rameter에 대한 접근이 제한된 상황에서도 서rogate 모델을 사용하면 실제 타겟 모델에 효과적인 전이가 가능한가?
  • RQ4트리거 삽입(다양한 문서 위치에) 또는 단어 치환과 같은 다양한 변형 전략이 공격 성공률와 탐지 가능성에 어떤 영향을 미치는가?
  • RQ5실제 동적 운영 환경을 시뮬레이션하기 위해 타겟 모델이 시간이 지남에 따라 업데이트되더라도 공격가 여전히 효과를 유지할 수 있는가?

주요 결과

  • 제안된 RELEVANT 프레임워크는 MS MARCO 데이터셋에서 적대적 문서의 평균 순위를 18.3로 기록하여, 기준선인 PAT 방법(31.6)보다 뚜렷이 뛰어나다.
  • 문서의 시작 부분에 트리거를 생성할 경우 공격 성능이 가장 우수하며, 이는 초기 토큰이 쿼리-문서 매칭에 핵심적인 역할을 한다는 것을 시사한다.
  • 교체할 단어의 수를 늘일수록 공격 성공률는 향상되지만, 동시에 탐지 위험도 증가하므로 효과성과 눈에 띄지 않음 사이의 트레이드오프를 강조한다.
  • 블랙박스 공격는 화이트박스 공격 수준의 성능을 달성하여, 서rogate 모델이 타겟 모델의 행동을 효과적으로 모방함을 입증한다.
  • 이 방법은 정적 및 동적 설정 모두에 일반화되어 있으며, 공격 과정 중 모델 업데이트에 대한 강건성을 보여준다.
  • 단지 타겟 모델의 하드 레이블 피드백만으로도 공격가 효과를 발휘함을 확인하여, 실제 블랙박스 환경에서의 실현 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.