[論文レビュー] XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models
XSTestは、大規模言語モデルにおける誇張された安全性の行動を検出するための診断テストセットであり、250件の安全なプロンプトと200件の危険なプロンプトから構成されている。これは、危険なプロンプトと語彙的に類似しているため、無害なクエリを拒否してしまうモデルの行動を検出することを目的としている。研究では、Llama2が著しい誇張された安全性を示していることが判明した一方、GPT-4は有用性と無害性の両立を最もうまく保っている。これは、安全性のトリガーに過剰適合するリスクを浮き彫りにしている。
Without proper safeguards, large language models will readily follow malicious instructions and generate toxic content. This risk motivates safety efforts such as red-teaming and large-scale feedback learning, which aim to make models both helpful and harmless. However, there is a tension between these two objectives, since harmlessness requires models to refuse to comply with unsafe prompts, and thus not be helpful. Recent anecdotal evidence suggests that some models may have struck a poor balance, so that even clearly safe prompts are refused if they use similar language to unsafe prompts or mention sensitive topics. In this paper, we introduce a new test suite called XSTest to identify such eXaggerated Safety behaviours in a systematic way. XSTest comprises 250 safe prompts across ten prompt types that well-calibrated models should not refuse to comply with, and 200 unsafe prompts as contrasts that models, for most applications, should refuse. We describe XSTest's creation and composition, and then use the test suite to highlight systematic failure modes in state-of-the-art language models as well as more general challenges in building safer language models.
研究の動機と目的
- 安全なプロンプトが危険なプロンプトと語彙的に類似しているために、誤って拒否されるという、大規模言語モデルにおける体系的失敗を特定すること。
- 有用性を犠牲にして安全性のトリガーに過剰に反応するという、未だ十分に検討されていない「誇張された安全性」の問題に対処すること。
- 最先端の大規模言語モデルにおけるこうした行動を診断するための標準化された手作業によるテストセットを開発すること。
- システムプロンプトとガーディアンレールのモデルの安全性行動に与える影響を評価し、一貫性のないおよび意図しない副作用を明らかにすること。
提案手法
- XSTestは、10種類の異なるプロンプトタイプに分類された250件の安全なプロンプトを含み、それぞれが明確に安全であり、拒否を引き起こすべきではないように設計されている。
- 検証のため、危険な要求を正しく拒否するかを確認する目的で、200件の危険なプロンプトの対照セットも含まれている。
- テストセットは、Llama2(システムプロンプトあり・なし)、Mistral 7B(ガーディアンレールプロンプトあり・なし)、GPT-4という3つの最先端の大規模言語モデルの評価に用いられている。
- モデルの応答は、安全なプロンプトに対する拒否行動について分析され、明確に正当なクエリに従わない場合を拒否と定義している。
- 評価は、危険なコンテンツに関連する特定の語句やフレーズに過剰に反応する「語彙的過剰適合(lexical overfitting)」を検出することに焦点を当てる。
- アノテーターが応答の拒否を評価し、モデル間での拒否行動を比較することで、体系的な失敗モードを同定している。

実験結果
リサーチクエスチョン
- RQ1最先端の大規模言語モデルは、危険なプロンプトと語彙的に類似している安全なプロンプトをどれほど拒否するのか。これは、誇張された安全性の兆候である。
- RQ2システムプロンプトとガーディアンレールは、大規模言語モデルにおける有用性と無害性のバランスにどのように影響するのか。
- RQ3XSTestのような標準化されたテストセットは、異なるモデルにおいて誇張された安全性行動を信頼性高く検出・測定できるのか。
- RQ4なぜ一部のモデル、例えばLlama2は、他の点で適切にキャリブレーションされているにもかかわらず、安全なプロンプトを著しく拒否するのか。
- RQ5プライバシー関連のプロンプトを含めることで、モデルの拒否行動にどのような影響が生じるのか。これは、個人情報への感受性をどのように露呈するのか。
主な発見
- Llama2は著しい誇張された安全性を示しており、安全なプロンプトの28%を拒否している。特に、感受性の高いトピックや危険な内容と語彙的に類似するプロンプトに対して顕著である。
- Llama2の元のシステムプロンプトを削除することで拒否率は低下するが、誇張された安全性は完全に解消されず、依然として過剰適合が続くことが示された。
- Mistral 7Bは元の形では安全性の誇張は見られないが、極めて危険なプロンプトに対しても従順であるため、無害性が不十分である。
- Mistral 7Bにガーディアンレールプロンプトを追加すると、危険な応答は減少するが、安全なプロンプトの拒否が増加する。これは、安全性の目的間のトレードオフを示している。
- GPT-4は最もバランスが良く、1件の危険なプロンプトを拒否したのみで、ほぼすべての安全なプロンプトに従順に応答している。ただし、プライバシー関連のプロンプトを除く。
- 本研究では、語彙的過剰適合が誇張された安全性の根本的原因であると特定した。これは、モデルが文脈的意図ではなく、特定のキーワードに反応してしまうことによる。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。