[論文レビュー] Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data
この論文は、公開データセットにわずかに改ざんされた好みのペアを挿入することで、悪意ある攻撃者が強化学習による人間フィードバック(RLHF)パイプラインを汚染する、新しい攻撃—Best-of-Venom—を提案する。これらの汚染された好みのペアを用いて報酬モデルを訓練することで、言語モデルが特定のエンティティ(例:'Coca Cola')を望みの感情(肯定的または否定的)を伴って生成するように操作でき、汚染データが1–5%のわずかな割合でも、目標の感情を持つ応答を生成する確率が最大95.2%に達する。
Reinforcement Learning from Human Feedback (RLHF) is a popular method for aligning Language Models (LM) with human values and preferences. RLHF requires a large number of preference pairs as training data, which are often used in both the Supervised Fine-Tuning and Reward Model training and therefore publicly available datasets are commonly used. In this work, we study to what extent a malicious actor can manipulate the LMs generations by poisoning the preferences, i.e., injecting poisonous preference pairs into these datasets and the RLHF training process. We propose strategies to build poisonous preference pairs and test their performance by poisoning two widely used preference datasets. Our results show that preference poisoning is highly effective: injecting a small amount of poisonous data (1-5\% of the original dataset), we can effectively manipulate the LM to generate a target entity in a target sentiment (positive or negative). The findings from our experiments also shed light on strategies to defend against the preference poisoning attack.
研究の動機と目的
- RLHFパイプラインにおける好みのデータセットの汚染可能性と有効性を調査すること。
- 悪意ある好みのペアを小規模に挿入することで報酬モデルおよび下流の言語モデルがどのようにバイアスを受けるかを理解すること。
- 汚染の影響が異なるRLHF段階、モデルサイズ、データ比にどのように影響するかを評価すること。
- 公開利用可能な好みのデータセットに依存する現在のRLHFトレーニングパイプラインにおける脆弱性を特定すること。
- このような好みの汚染攻撃に対する防御戦略を検討すること。
提案手法
- 各ペアにプロンプト、2つの応答(一方は目標エンティティを望みの感情で含む)、およびその応答を好むラベルを含む、巧みに改ざんされた好みのペアを公開された好みのデータセットに挿入する。
- 汚染されたデータセット上で報酬モデル(RM)を訓練し、目標エンティティを望みの感情で含む生成物を好むバックドアを学習させる。
- 汚染されたRMをBest-of-N(BoN)強化学習ループ内で使用し、言語モデルを微調整することで、汚染された好みの影響を強化する。
- 汚染例の数(データセットの1–5%)を系統的に変化させ、さまざまなモデルサイズとタスク(指示従い、質問応答)でテストする。
- RMの出力順位を分析し、汚染された好みが他の応答と比べて目標の感情を持つ生成物をどれほど強く上昇させるかを可視化する。
- LMとRMのトレーニングデータを分離することで攻撃効果を低下させるなどの防御戦略を評価する。

実験結果
リサーチクエスチョン
- RQ1わずかに改ざんされた好みのペアを戦略的に挿入することで、RLHF中に言語モデルの挙動を効果的に操作できるか?
- RQ2報酬モデルが汚染データにどれほど感受性を示すかが、最終的な言語モデルの生成挙動にどのように影響するか?
- RQ3Best-of-N強化学習プロセスが、汚染された好みのデータの影響をどの程度強化するか?
- RQ4モデルサイズ、データ比、トレーニング段階などの要因が、好みの汚染の成功にどのように影響するか?
- RQ5RLHFパイプラインにおける好みの汚染攻撃を効果的に緩和できる防御策は何か?
主な発見
- 公開データセットに僅か1–5%の汚染された好みのペアを挿入するだけで、目標の感情を持つ応答を生成する確率が80.4–95.2%に上昇する。
- 汚染されたデータで訓練された報酬モデルは、多数の応答がエンティティを言及しない中でも、目標エンティティを望みの感情で含む生成物を強く好む。
- Best-of-N強化学習は汚染効果を強化する:1回のRLイテレーションでも、ほとんどの実験で望ましい生成物の頻度が2倍に増加する。
- 攻撃は複数のタスク(指示従い、質問応答)および複数のモデルサイズで有効であり、広範な適用可能性を示している。
- LMとRMのトレーニングデータを分離する防御戦略は攻撃効果を低下させ、実用的な緩和策である可能性を示している。
- 従来の検出手法は、汚染された好みが意味的に妥当で、本物のデータと区別がつきにくいため、好みの汚染に対して無効である。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。