Skip to main content
QUICK REVIEW

[論文レビュー] A StrongREJECT for Empty Jailbreaks

Alexandra Souly, Qingyuan Lu|arXiv (Cornell University)|Feb 15, 2024
Digital and Cyber Forensics被引用数 4
ひとこと要約

この論文では、既存の評価手法の欠陥を是正することで、大規模言語モデルに対するjailbreak攻撃を公平に評価するための新しいベンチマーク、StrongREJECTを紹介する。6つの禁止カテゴリに該当する、より高品質で明確かつ回答可能な有害な質問を提供し、単なる毒性や拒否失敗の有無ではなく、応答の有用性を重視するより正確な自動採点システムを提案することで、性能推定におけるバイアスを低減し、一部のjailbreak攻撃が悪意のないタスクでもモデル性能を低下させることを示している。

ABSTRACT

Most jailbreak papers claim the jailbreaks they propose are highly effective, often boasting near-100% attack success rates. However, it is perhaps more common than not for jailbreak developers to substantially exaggerate the effectiveness of their jailbreaks. We suggest this problem arises because jailbreak researchers lack a standard, high-quality benchmark for evaluating jailbreak performance, leaving researchers to create their own. To create a benchmark, researchers must choose a dataset of forbidden prompts to which a victim model will respond, along with an evaluation method that scores the harmfulness of the victim model's responses. We show that existing benchmarks suffer from significant shortcomings and introduce the StrongREJECT benchmark to address these issues. StrongREJECT's dataset contains prompts that victim models must answer with specific, harmful information, while its automated evaluator measures the extent to which a response gives useful information to forbidden prompts. In doing so, the StrongREJECT evaluator achieves state-of-the-art agreement with human judgments of jailbreak effectiveness. Notably, we find that existing evaluation methods significantly overstate jailbreak effectiveness compared to human judgments and the StrongREJECT evaluator. We describe a surprising and novel phenomenon that explains this discrepancy: jailbreaks bypassing a victim model's safety fine-tuning tend to reduce its capabilities. Together, our findings underscore the need for researchers to use a high-quality benchmark, such as StrongREJECT, when developing new jailbreak attacks. We release the StrongREJECT code and data at https://strong-reject.readthedocs.io/en/latest/.

研究の動機と目的

  • 既存のjailbreak評価ベンチマークに内在する深刻な欠陥(質問の低品質や採点バイアス)が攻撃成功度を誇張していることの特定と是正。
  • 一部のjailbreaking手法が、GPT-4のMMLUゼロショット精度を78%から35%まで低下させることを実証。
  • 6つのコンテンツカテゴリにまたがる明確で回答可能な有害な質問を用い、評価の公平性を高める新しいベンチマーク、StrongREJECTの提案。
  • 有害な目的を達成する際の応答の有用性を重視する採点アルゴリズムの開発により、人間の判断とより整合性をとる。単なる拒否や毒性の有無ではなく、有用性を基準とする。
  • jailbreak効果の測定に、より正確で信頼性の高い基準を提供し、低品質な応答による成功度の誇張を低減する。

提案手法

  • 6つの広く禁止されているコンテンツカテゴリに該当する、明確で回答可能かつ具体的な質問を、新規に作成し、既存のデータセットから収集する。
  • 単なる毒性や拒否失敗の検出ではなく、有害な目的達成における応答の有用性に基づいて応答を評価する新しい自動採点システムを構築する。
  • 人間によるアノテーションによる判断を用いて、新しい採点アルゴリズムのキャリブレーションと妥当性を検証し、人間の認識と応答品質・攻撃効果性の評価が一致することを保証する。
  • 新ベンチマークを用いて、閉鎖型(GPT-4)および非制限型オープンソースモデル(Dolphin)の複数のjailbreak手法を評価し、性能低下と攻撃成功確率を測定する。
  • 質問、採点コード、評価結果を含む完全なベンチマークを、再現可能性とコミュニティ利用を目的として、公開のGitHubリポジトリに実装・リリースする。
  • ブートストラップ信頼区間を用いて、新ベンチマーク上での複数のjailbreak手法間の性能差の統計的有意性を評価する。
Figure 1 : MMLU zero-shot accuracy using GPT-4 after applying jailbreaks to the MMLU prompt. Accuracy is calculated over valid responses only. Most of these jailbreaks decrease accuracy.
Figure 1 : MMLU zero-shot accuracy using GPT-4 after applying jailbreaks to the MMLU prompt. Accuracy is calculated over valid responses only. Most of these jailbreaks decrease accuracy.

実験結果

リサーチクエスチョン

  • RQ1既存のjailbreakベンチマークは、曖昧で回答不能または低品質な質問のため、攻撃成功度をどの程度誇張しているか?
  • RQ2異なるjailbreak手法は、MMLUのような悪意のない非悪意タスクにおけるLLMの性能にどのように影響を与えるか?
  • RQ3既存のベンチマークにおける現在の自動採点手法は、低品質なjailbreak応答の効果を過大評価する傾向にどの程度バイアスをもたらしているか?
  • RQ4提案されたStrongREJECT自動採点システムは、個々の応答品質および全体的なjailbreak効果性の評価において、人間の判断とどの程度整合性を示すか?
  • RQ5より高品質な質問とより正確な採点方式を備えた新ベンチマークは、jailbreak能力のよりバランスの取れた信頼性の高い評価を可能にするか?

主な発見

  • いくつかのjailbreak手法は、GPT-4のMMLUベンチマークにおけるゼロショット精度を、78%から有効な複数選択肢の応答に限っても35%まで著しく低下させる。
  • 非制限型Dolphinモデルでは、Base64オブスカレーションやズールー語への翻訳といった特定のjailbreakが、有害な質問に対する正答率を低下させ、性能劣化を示している。
  • 提案されたStrongREJECT自動採点システムは、特に低品質な応答において、人間の判断と強い整合性を示しており、個々の応答品質および全体的なjailbreak効果性の評価において優れた適合性を示している。
  • 既存の自動採点システムは、単に有毒なコンテンツを含むか、明示的な拒否に失敗した応答に点数を与えることで、jailbreak成功度を過大評価する傾向にあり、性能スコアが誇張されている。
  • 新ベンチマークは、一部のjailbreakが効果的でないか、モデルの能力を損なう可能性があることを特定し、すべてのjailbreakが使い捨ての潜在的リスクを向上させるわけではないことを明らかにした。
  • 改善された質問セットと採点アルゴリズムを備えたStrongREJECTベンチマークは、既存のベンチマークよりもよりバランスの取れた正確なjailbreak効果性の評価を提供している。
Figure 2 : StrongREJECT improves on existing jailbreak benchmarks by asking questions that are specific, answerable, and harmful across six categories of content that are widely rejected by models. StrongREJECT also uses an autograder that emphasizes the usefulness of a response for achieving a part
Figure 2 : StrongREJECT improves on existing jailbreak benchmarks by asking questions that are specific, answerable, and harmful across six categories of content that are widely rejected by models. StrongREJECT also uses an autograder that emphasizes the usefulness of a response for achieving a part

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。