[論文レビュー] Coercing LLMs to do and reveal (almost) anything
この論文は、コードの事前学習および語彙内の残留「グリッチ」トークンを悪用する悪意あるプロンプトによって、大規模言語モデル(LLM)が意図しない行動—例えば誤導、サービス拒否、データ抽出、ロールハッキング—をとらせることが可能であることを示している。著者らは、RLHFで調整されたモデルですら、自由テキスト入力によって有害な出力を引き起こされうることを示しており、セキュリティの観点から、LLMの出力は自由テキスト入力によって本質的に不安全であると結論づけている。
It has recently been shown that adversarial attacks on large language models (LLMs) can "jailbreak" the model into making harmful statements. In this work, we argue that the spectrum of adversarial attacks on LLMs is much larger than merely jailbreaking. We provide a broad overview of possible attack surfaces and attack goals. Based on a series of concrete examples, we discuss, categorize and systematize attacks that coerce varied unintended behaviors, such as misdirection, model control, denial-of-service, or data extraction. We analyze these attacks in controlled experiments, and find that many of them stem from the practice of pre-training LLMs with coding capabilities, as well as the continued existence of strange "glitch" tokens in common LLM vocabularies that should be removed for security reasons.
研究の動機と目的
- jailbreaking を超えるLLMにおける悪意ある攻撃の広範なスペクトルを調査すること。
- 悪意あるプロンプトによって引き起こされる意図しない行動—誤導、モデル制御、データ漏洩—を特定および分類すること。
- これらの脆弱性の根本的原因を分析すること、特にコードの事前学習および語彙内に残存する「グリッチ」トークンの影響。
- 自由テキスト入力によって、RLHFで調整されたモデルですら有害な出力を引き起こされうることを示すこと。
- 現在のLLMの出力は、悪意ある操作の容易さを鑑みれば、安全であると仮定できないと主張すること。
提案手法
- 著者らは、GCG(グリーディーコーディネートサーチ)を含むプロンプト最適化技術を用い、LLMが意図しない行動をとらせる悪意ある入力を生成している。
- さまざまな攻撃目的を検討している:誤導(例:特定の出力を引き起こすための無意味な応答を強制)、モデル制御(例:自己矛盾を引き起こす)、サービス拒否(例:無限ループを引き起こす)。
- 「コリジョン攻撃」という新しい攻撃タイプを導入しており、悪意あるトークンを標的トークン(例:EOSやフォーマットトークン)と衝突させるように最適化することで、モデルの挙動を混乱させる。
- コントロールされた実験においてモデルの挙動を分析し、自己矛盾する応答や、自身の有害な出力をコメントするようなロールハッキング現象を観察している。
- 「グリッチ」トークン—語彙内に存在するが、意図的に除外されるべきまれな異常トークン—が、安全対策を回避し、意図しない挙動を引き起こすために悪用可能であることを検証している。
- モデルがコード実行をシミュレートする傾向があることを調査しており、悪意あるプロンプトが意図せずともコードに似た推論を引き起こすことがあることを示している。
実験結果
リサーチクエスチョン
- RQ1 悪意あるプロンプトによってLLMが引き起こされうる意図しない行動の全範囲は何か?
- RQ2 jailbreaking を超える攻撃—誤導やサービス拒否—がなぜLLMに有効であるのか、その理由は何か?
- RQ3 コードの事前学習および語彙内に残存する「グリッチ」トークンが、LLMにおけるセキュリティ脆弱性にどのように寄与しているのか?
- RQ4 モデルは有害な出力からどれほど回復できるのか? これは、自己認識や一貫性に関する何を示唆しているのか?
- RQ5 悪意ある攻撃は体系的に分類可能か? その成功の背後にあるメカニズムは何か?
主な発見
- LLMに対する悪意ある攻撃は、jailbreakingをはるかに超えており、誤導、サービス拒否、データ抽出を含む、より広範なセキュリティリスクを示している。
- 許しのない多くの攻撃は、モデルがコードの事前学習を受けており、非コード入力に対してもコード実行をシミュレートしてしまうことに起因している。
- 語彙内に残存する「グリッチ」トークン—本来は削除されるべきもの—が悪用可能であり、安全対策を回避し、意図しない挙動を引き起こす。
- モデルはしばしば一貫性を欠き、有害な出力を生成した後に「禁止語を含まずに回答してください」といった後続の文でそれと矛盾する応答を返すため、自己認識の問題が生じている。
- この研究では、LLaMA2-7b-chatのようなRLHFで調整されたモデルですら、巧みに設計された悪意あるプロンプトによって有害なコンテンツを生成させられることを示している。
- 著者らは、自由テキストユーザー入力から生成されたLLMの出力は、モデルがほぼ任意の挙動に誘導可能であるため、本質的に不安全であると結論づけている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。