[論文レビュー] Order-Disorder: Imitation Adversarial Attacks for Black-box Neural Ranking Models
本稿では、2段階のアプローチを用いてニューラルパassageランキングモデルに対するブラックボックス敵対的攻撃を提案する。まず、ターゲットモデルのランキング出力を用いて、クエリ-パassageの三つ組み(query, positive candidate, negative candidate)に対するペairワイズ学習により、ランキングの模倣モデルを訓練する。次に、新しい勾配ベースのペアワイズアンカーに基づくトリガー(PAT)生成器を用いて、非常に転送可能で隠蔽された敵対的トリガーを生成する。本手法は、最小限で目に見えない摂動で99.2%の攻撃成功率を達成し、ブラックボックスランキングシステムにおける深刻な脆弱性を露呈する。
Neural text ranking models have witnessed significant advancement and are increasingly being deployed in practice. Unfortunately, they also inherit adversarial vulnerabilities of general neural models, which have been detected but remain underexplored by prior studies. Moreover, the inherit adversarial vulnerabilities might be leveraged by blackhat SEO to defeat better-protected search engines. In this study, we propose an imitation adversarial attack on black-box neural passage ranking models. We first show that the target passage ranking model can be transparentized and imitated by enumerating critical queries/candidates and then train a ranking imitation model. Leveraging the ranking imitation model, we can elaborately manipulate the ranking results and transfer the manipulation attack to the target ranking model. For this purpose, we propose an innovative gradient-based attack method, empowered by the pairwise objective function, to generate adversarial triggers, which causes premeditated disorderliness with very few tokens. To equip the trigger camouflages, we add the next sentence prediction loss and the language model fluency constraint to the objective function. Experimental results on passage ranking demonstrate the effectiveness of the ranking imitation attack model and adversarial triggers against various SOTA neural ranking models. Furthermore, various mitigation analyses and human evaluation show the effectiveness of camouflages when facing potential mitigation approaches. To motivate other scholars to further investigate this novel and important problem, we make the experiment data and code publicly available.
研究の動機と目的
- ブラックボックスのニューラルパassageランキングモデルが、モデルの透明性が限られている状況下でも敵対的攻撃に対して脆弱であるかを調査すること。
- ターゲットモデルのホワイトボックスアクセスを必要としない転送可能な敵対的攻撃手法を開発すること。
- 自然さと意味的一致性の制約を組み込むことで、効果的かつ目に見えない敵対的トリガーを生成すること。
- 緩和戦略および人間の知覚に対する攻撃の頑健性を評価すること。
- 今後のニューラルランキングシステムの防御メカニズムに関する研究を促進するために、コードとデータを公開すること。
提案手法
- ターゲットモデルのランキングリストから抽出した三つ組み(クエリ、ポジティブ候補、ネガティブ候補)を用いて、ペアワイズBERTランカーによる順序学習を用いて、ランキング模倣モデルを訓練する。この際、関連性スコアの必要はない。
- 模倣モデルの勾配を活用し、ペアワイズ目的関数に従って、順序を操作する敵対的トリガーの生成をガイドする。
- 各候補パassageに合わせてトリガーを最適化するアンカーに基づく最適化を用いて、順序の混乱を最大化するペアワイズアンカーに基づくトリガー(PAT)生成器を設計する。
- 自然なトリガーの生成を保証するため、次文予測損失と言語モデルの自然さ制約を目的関数に統合する。
- 生成されたトリガーをパassageテキストの先頭、中央、または末尾に挿入し、元のブラックボックスモデルへの転送性を評価する。
- 人間による評価と緩和解析を用いて、トリガーの見えにくさと防御に対する頑健性を検証する。
実験結果
リサーチクエスチョン
- RQ1ターゲットモデルのランキング出力のみを用いて、ランキング模倣モデルを用いてブラックボックスのニューラルパassageランキングモデルを効果的に逆設計できるか?
- RQ2提案されたPATトリガー生成器は、最小限で目に見えない変更で、ターゲットモデルへの敵対的摂動をどれほど効果的に転送できるか?
- RQ3自然さと意味的一致性の制約は、敵対的トリガーの隠蔽性をどの程度向上させるか?
- RQ4トリガーの配置(先頭、中央、末尾)が攻撃成功率と見えにくさに与える影響は何か?
- RQ5入力の前処理や敵対的訓練などの緩和戦略が適用された場合でも、本攻撃は効果を保つことができるか?
主な発見
- ランキング模倣モデルはTREC DL 2019で89.9 MRR@10を達成し、ターゲットモデルの90.1に非常に近い性能を示し、強力な転送性を裏付けた。
- PATベースの攻撃は、トリガーをパassageの末尾に挿入した場合に99.2%の攻撃成功率を達成し、17.2%の無関係なパassageがトップ100内にランクインした。
- 自然さと一貫性の制約を組み込んだトリガーは、人間評価により著しく自然で検出されにくく、その効果が確認された。
- 言語モデルの自然さ制約や次文予測損失を削除しても攻撃は依然として有効であるが、性能はわずかに低下した。
- 特にパassageの末尾にトリガーを挿入した場合、攻撃成功率とトリガーの見えにくさの両面でベースラインを上回った。
- 人間評価により、PATで生成されたトリガーはベースラインに比べてより自然で意味的に一貫しており、隠蔽効果が向上していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。