Skip to main content
QUICK REVIEW

[論文レビュー] MART: Improving LLM Safety with Multi-round Automatic Red-Teaming

Suyu Ge, Chunting Zhou|arXiv (Cornell University)|Nov 13, 2023
Topic Modeling被引用数 4
ひとこと要約

MARTは、敵対的LLMと標的LLMを対戦させることで段階的にLLMの安全性を向上させる、複数ラウンドにわたる自動レッドチームフレームワークを提案する。敵対的LLMは攻撃を段階的に強化し、標的LLMはその攻撃に対する安全な応答で微調整される。4ラウンドを経て、MARTは攻撃的ベンチマークで違反率を最大84.7%まで低下させ、人的なレッドチームによる評価を経たモデルと同等の安全性を達成しながら、モデルの有用性を維持する。

ABSTRACT

Red-teaming is a common practice for mitigating unsafe behaviors in Large Language Models (LLMs), which involves thoroughly assessing LLMs to identify potential flaws and addressing them with responsible and accurate responses. While effective, manual red-teaming is costly, and existing automatic red-teaming typically discovers safety risks without addressing them. In this paper, we propose a Multi-round Automatic Red-Teaming (MART) method, which incorporates both automatic adversarial prompt writing and safe response generation, significantly increasing red-teaming scalability and the safety of the target LLM. Specifically, an adversarial LLM and a target LLM interplay with each other in an iterative manner, where the adversarial LLM aims to generate challenging prompts that elicit unsafe responses from the target LLM, while the target LLM is fine-tuned with safety aligned data on these adversarial prompts. In each round, the adversarial LLM crafts better attacks on the updated target LLM, while the target LLM also improves itself through safety fine-tuning. On adversarial prompt benchmarks, the violation rate of an LLM with limited safety alignment reduces up to 84.7% after 4 rounds of MART, achieving comparable performance to LLMs with extensive adversarial prompt writing. Notably, model helpfulness on non-adversarial prompts remains stable throughout iterations, indicating the target LLM maintains strong performance on instruction following.

研究の動機と目的

  • LLMの安全性評価における人的レッドチームの高コストとスケーラビリティの限界を解消すること。
  • 進化するモデルの脆弱性に適応できない静的特性を持つ既存の自動レッドチーム手法の課題を克服すること。
  • 反復的相互作用を通じて、敵対的プロンプト生成と標的モデルの安全性の両方を同時に向上させるスケーラブルで自動化されたフレームワークを開発すること。
  • 安全性の整合性を図る過程で、非攻撃的タスクにおけるモデルの有用性を維持すること。
  • モデルベースで自己改善可能な安全性評価を可能にすることで、人的アノテーターに依存するレッドチームの依存度を低減すること。

提案手法

  • 敵対的LLMは、過去の成功した攻撃からのフィードバックを活用して、より効果的な悪意あるプロンプトを生成するように訓練される。
  • 標的LLMはその敵対的プロンプトに応答し、その出力は安全報酬モデルを用いて不適切な出力を特定するために評価される。
  • 不適切な応答を引き起こしたプロンプトは、次のラウンドにおける敵対的LLMの微調整に使用され、攻撃能力が向上する。
  • 安全かつ高品質な応答は標的LLM自体の微調整に活用され、安全性の整合性が強化される。
  • 両モデルが敵対的競争を通じて反復的に改善するプロセスが複数ラウンドにわたり繰り返される。
  • 特定のラウンドにおいて、文脈蒸留や拒否サンプリングといった追加技術が導入され、訓練データの多様性と質が向上する。
Figure 1: Illustration of Mart . On the left figure, according to the feedback from the evaluator, Mart first identifies successful attacks from generated prompts, and then leverages them to train the adversarial LLM $\mathcal{M}_{adv}$ . On the contrary, the right figure illustrates a successful de
Figure 1: Illustration of Mart . On the left figure, according to the feedback from the evaluator, Mart first identifies successful attacks from generated prompts, and then leverages them to train the adversarial LLM $\mathcal{M}_{adv}$ . On the contrary, the right figure illustrates a successful de

実験結果

リサーチクエスチョン

  • RQ1人的レッドチームアノテーターに依存せずに、自動的かつ反復的なレッドチームフレームワークがLLMの安全性を効果的に向上させられるか。
  • RQ2継続的な敵対的プロンプト生成が進化するモデルの脆弱性に適応し、持続的な安全性向上を実現できるか。
  • RQ3指示従いやすさや有用性タスクにおけるモデルのパフォーマンスが低下することなく、安全性の整合性を達成できるか。
  • RQ4人的レッドチームやベースライン自動手法と比較して、自動レッドチームが違反率をどの程度削減できるか。
  • RQ5敵対的プロンプト生成と安全応答生成の統合が、モデルの耐性をどのように共同で強化するか。

主な発見

  • MARTの4ラウンドを経て、最小限の安全性整備が施されたLLMの違反率は、攻撃的プロンプトベンチマークで最大84.7%低下した。
  • MARTが達成した安全性の向上は、ChatGPTなど人的なレッドチームによる広範な微調整を経たモデルと同等の水準であった。
  • 非攻撃的指示従いやすさベンチマークにおけるモデルの有用性は、全ラウンドにわたり安定しており、コアな能力の低下は確認されなかった。
  • ラウンドを重ねるごとにより洗練された敵対的プロンプトを生成することで、MARTは進化するモデルの脆弱性に効果的に適応した。
  • 拒否サンプリングと文脈蒸留の統合により、敵対的訓練データの多様性と質がさらに向上した。
  • 人的評価では、不適切な出力の発生が53.7%削減されたことが確認され、安全性整備の実世界への影響が裏付けられた。
(a) Safety trend on our SafeEval
(a) Safety trend on our SafeEval

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。