[論文レビュー] Topic-oriented Adversarial Attacks against Black-box Neural Ranking Models
本稿では、ブラックボックスなニューラルランクイングモデル向けに、強化学習を用いたサーヴィエイティングモデルを介して意味を保ちつつ、同じトピックの複数のクエリに対してターゲットドキュメントの順位を向上させる、画期的なトピック指向の敵対的攻撃(TARA)フレームワークを提案する。この手法は、既存の攻撃を著しく上回り、MS MARCOでブラックボックス設定下で平均順位改善18.3 vs. 31.6を達成する。
Neural ranking models (NRMs) have attracted considerable attention in information retrieval. Unfortunately, NRMs may inherit the adversarial vulnerabilities of general neural networks, which might be leveraged by black-hat search engine optimization practitioners. Recently, adversarial attacks against NRMs have been explored in the paired attack setting, generating an adversarial perturbation to a target document for a specific query. In this paper, we focus on a more general type of perturbation and introduce the topic-oriented adversarial ranking attack task against NRMs, which aims to find an imperceptible perturbation that can promote a target document in ranking for a group of queries with the same topic. We define both static and dynamic settings for the task and focus on decision-based black-box attacks. We propose a novel framework to improve topic-oriented attack performance based on a surrogate ranking model. The attack problem is formalized as a Markov decision process (MDP) and addressed using reinforcement learning. Specifically, a topic-oriented reward function guides the policy to find a successful adversarial example that can be promoted in rankings to as many queries as possible in a group. Experimental results demonstrate that the proposed framework can significantly outperform existing attack strategies, and we conclude by re-iterating that there exist potential risks for applying NRMs in the real world.
研究の動機と目的
- 単一のクエリペアを超えたニューラルランクイングモデルを標的とする敵対的攻撃のギャップを埋めるために、より現実的なトピック指向の攻撃シナリオを導入すること。
- モデルの勾配に依存せず、ターゲットモデルからのハードラベルフィードバックのみに依存する意思決定ベースのブラックボックス攻撃フレームワークを開発すること。
- トピックに敏感な報酬によって誘導されるマルコフ意思決定過程として攻撃をモデル化することで、攻撃の有効性を向上させること。
- 静的および動的設定の両方を評価し、モデルが時間経過とともに更新されるような現実世界の展開シナリオをシミュレートすること。
- 認識されにくいが非常に効果的な一般化された、トピック全体にわたる摂動がニューラルランクイングモデルの脆弱性を露呈することを示すこと。
提案手法
- 攻撃をマルコフ意思決定過程(MDP)として定式化し、エージェントがクエリグループ全体における順位向上を最大化するように摂動を生成する方法を学習する。
- ポリシーネットワークの強化学習プロセスをガイドするために、ターゲットモデルの挙動をシミュレートするサーヴィエイティングランクイングモデルを採用する。
- 同じトピックグループ内の可能な限り多くのクエリに対してターゲットドキュメントの順位を向上させるよう促進する、トピック指向の報酬関数を設計する。
- ポリシー勾配法(例:PPO)を用いて攻撃ポリシーを最適化し、摂動はトリガ挿入または語の置換によって適用する。
- 静的および動的設定をサポートする:動的モードでは、新しいフィードバックを用いてポリシーを再トレーニングすることで、モデルの更新に適応する。
- ドキュメントの異なる位置(開始部、中間部、終了部)にトリガを挿入し、置換する語の数を変化させることで、有効性と認識されにくさのトレードオフを調査する。
実験結果
リサーチクエスチョン
- RQ1同じトピックを共有するクエリのグループ全体に対して、単一のクエリではなくターゲットドキュメントを向上させるような敵対的摂動を設計できるか?
- RQ2意思決定ベースのブラックボックス設定下で、強化学習に基づくアプローチが、このようなトピック全体にわたる敵対的例を生成するのにどの程度有効か?
- RQ3内部パrameterへのアクセスが制限された状況でも、サーヴィエイティングモデルを用いることで、実際のターゲットモデルへの攻撃転送が有効に可能か?
- RQ4トリガ挿入(さまざまなドキュメント位置)や語の置換といった、異なる摂動戦略が攻撃成功率と検出可能性にどのように影響するか?
- RQ5ターゲットモデルが時間経過とともに更新される状況でも、攻撃は依然として有効に機能するか?(現実世界の動的展開を模倣する。)
主な発見
- 提案されたRELEVANTフレームワークは、MS MARCOデータセットにおいて、敵対的ドキュメントの平均順位が18.3に達し、ベースラインのPAT手法(31.6)を著しく上回る。
- ドキュメントの開始部にトリガを生成することが、最も優れた攻撃パフォーマンスをもたらし、初期トークンがクエリ・ドキュメントマッチングにおいて重要な役割を果たしていることを示している。
- 置換する語の数を増やすことで攻撃成功率が向上するが、同時に検出リスクも上昇するため、有効性と認識されにくさのトレードオフが顕著である。
- ブラックボックス攻撃は、ホワイトボックス攻撃と同等のパフォーマンスを達成しており、サーヴィエイティングモデルがターゲットモデルの挙動を効果的に模倣していることを示している。
- この手法は静的および動的設定の両方で一般化され、攻撃プロセス中にモデルの更新に対してもロバストであることが示された。
- 攻撃は極めて限定的なアクセス(ターゲットモデルからのハードラベルフィードバックのみ)でも有効であるため、現実世界のブラックボックスシナリオにおける実現可能性が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。