[論文レビュー] HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
HarmBench は LLM の自動赤チームの標準化された大規模ベンチマークを提供し、堅牢な拒否を向上させる効率的な敵対的トレーニング法(R2D2)を導入します。
Automated red teaming holds substantial promise for uncovering and mitigating the risks associated with the malicious use of large language models (LLMs), yet the field lacks a standardized evaluation framework to rigorously assess new methods. To address this issue, we introduce HarmBench, a standardized evaluation framework for automated red teaming. We identify several desirable properties previously unaccounted for in red teaming evaluations and systematically design HarmBench to meet these criteria. Using HarmBench, we conduct a large-scale comparison of 18 red teaming methods and 33 target LLMs and defenses, yielding novel insights. We also introduce a highly efficient adversarial training method that greatly enhances LLM robustness across a wide range of attacks, demonstrating how HarmBench enables codevelopment of attacks and defenses. We open source HarmBench at https://github.com/centerforaisafety/HarmBench.
研究の動機と目的
- LLMsに対する自動的な赤チーム評価を標準化・スケーラブルに行うための必要性を動機づける。
- HarmBench を設計して、赤チーム評価における幅広さ、比較可能性、堅牢な指標を実現する。
- 多様な行動、モデル、防御策にわたる大規模で再現性のある評価を提供する。
- 効率的な敵対的トレーニング手法を通じた攻撃と防御の共同開発を示す。
提案手法
- 赤チームの効果の主要指標として ASR(attack success rate)を定義する。
- テキストおよびマルチモーダルの510 の有害な行動を含む HarmBench を検証セットとテストセットに分割して整理する。
- テストケースを生成し、グリーディー デコードでモデルの完了を生成し、堅牢な分類器で評価する標準化評価パイプラインを提供する。
- 著作権行為のハッシュベース分類器と、その他の有害な行為のための非著作権分類器を微調整して ASR を計算する。
- Robust Refusal Dynamic Defense(R2D2)を導入し、テストケースを更新し、永続的なテストプールを用いてモデルの拒否を最適化する敵対的トレーニングフレームワーク。
- 永続的なテストケースを持つ GCG ベースの敵対者を用い、敵対的トレーニングを効率化して堅牢性を最大化する。
実験結果
リサーチクエスチョン
- RQ1自動赤チーム評価を標準化して、方法やモデル間で公正かつ大規模な比較を可能にするにはどうすればよいか?
- RQ2モデルサイズ、トレーニング手順、防御戦略が自動赤チームへの堅牢性に与える影響は何か?
- RQ3自動赤チームを用いた敵対的トレーニング(R2D2)は、一般的な能力を損なうことなくモデルの拒否を改善できるか?
- RQ4文脈的およびマルチモーダルな有害行為は、標準的なテキストのみの有害行為と比較して ASR および防御効果にどのように影響するか?
- RQ5異なるモデルファミリ間で堅牢性がモデルサイズに依存しないという証拠はあるか?
主な発見
- 1つの攻撃や防御がすべてのモデルと行動に対して一様に効果的であるとは限らない。
- 堅牢性はモデルサイズに大きく依存せず、モデルファミリと訓練手順によって大きく異なる。
- 文脈的およびマルチモーダルな有害行為は、いくつかの文脈ないしは非文脈的な有害行為より平均して高い ASR を示す一方、著作権関連の有害行為はハッシュベースの著作権検出が厳格なため ASR が低い。
- R2D2 は彼らの実験で GCG 攻撃に対するモデルレベルの防御の中で最先端の堅牢性を達成している。
- 自動化された赤チームを用いた敵対的トレーニングは、さまざまな攻撃に対して ASR を大幅に低減し、MT-Bench の一般的知識性能を大幅に損なうことなく。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。