[論文レビュー] On the Safety of Open-Sourced Large Language Models: Does Alignment Really Prevent Them From Being Misused?
この論文では、オープンソースでアライメントされた大規模言語モデル(LLM)のテキスト生成中の確率分布を操作することで、複雑なプロンプト工学を必要とせずに、有害または機密コンテンツの生成を可能にするモデルハッキング攻撃「ProMan」を紹介している。この手法は4つのLLMにおいてアライメントセーフティ機構を効果的に回避し、現在のアライメント技術が不正利用を完全に防止できていないことを示している。
Large Language Models (LLMs) have achieved unprecedented performance in Natural Language Generation (NLG) tasks. However, many existing studies have shown that they could be misused to generate undesired content. In response, before releasing LLMs for public access, model developers usually align those language models through Supervised Fine-Tuning (SFT) or Reinforcement Learning with Human Feedback (RLHF). Consequently, those aligned large language models refuse to generate undesired content when facing potentially harmful/unethical requests. A natural question is "could alignment really prevent those open-sourced large language models from being misused to generate undesired content?''. In this work, we provide a negative answer to this question. In particular, we show those open-sourced, aligned large language models could be easily misguided to generate undesired content without heavy computations or careful prompt designs. Our key idea is to directly manipulate the generation process of open-sourced LLMs to misguide it to generate undesired content including harmful or biased information and even private data. We evaluate our method on 4 open-sourced LLMs accessible publicly and our finding highlights the need for more advanced mitigation strategies for open-sourced LLMs.
研究の動機と目的
- オープンソースLLMにおけるアライメントが、有害または機密コンテンツの不正利用を真正に防止しているかどうかを調査すること。
- 重い計算やプロンプト工学を必要とせず、オープンソースLLMの生成プロセスを狙った実用的な攻撃手法を開発すること。
- アライメント済みLLMでさえ、確率分布の直接的改ざんによって不正利用のリスクを有する可能性があることを実証すること。
- このようなモデルハッキング脅威を軽減するための事前学習および微調整段階での対策を提案すること。
提案手法
- ProManは、オープンソースLLMの自己回帰的生成プロセス中にトークンの確率分布を直接操作する。
- 悪意あるプロンプトに対して、特定の肯定的トークン(例:'Absolutely! Here’s')を応答の先頭に強制的に生成させる。
- 目的トークンのロジットを最適化することで、確率をほぼ100%にまで引き上げる微分可能最適化プロセスを用いる。
- 確率シフトの大きさを制御する重要なハイパーパrameter δ が存在し、実験では信頼性の高いトークン生成を確保するため δ = 200 を使用した。
- 攻撃は最初の数個の出力トークンを標的とし、モデルの生成を有害または機密コンテンツ向けに「アンロック」する。
- モデル重みの変更なしに適用可能であるため、軽量でアライメント後攻撃としての特徴を持つ。
実験結果
リサーチクエスチョン
- RQ1SFT や RLHF といったアライメント技術を用いても、オープンソースでアライメントされたLLMが有害コンテンツの生成に不正利用され得るか?
- RQ2プロンプト工学ではなく、生成プロセスそのものの直接的改ざんによって、アライメントセーフティ機構を回避できるか?
- RQ3ProManは複数のオープンソースLLMに対して、プライベートデータや有害コンテンツの抽出にどの程度効果的か?
- RQ4現在のアライメント戦略は、モデルハッキング攻撃を防止する上でどのような限界を有するか?
- RQ5このような攻撃を緩和するための事前学習または微調整段階での対策は何か?
主な発見
- プライベートデータの要求に対して、Vicuna、Llama-2-LoRA、Marcoroniでは100%の攻撃成功率(ASR-P)、ChatGLMでは95%のASR-Pを達成した。
- 有害コンテンツ生成の攻撃成功率はVicunaで91%、Llama-2-LoRAで95%であり、全モデルにわたり高い有効性を示した。
- すべての評価対象LLMにおいて、ヒューリスティックおよび最適化ベースのベースラインを上回り、より高いASR-PおよびASR-Aスコアを達成した。
- 事例研究において正規表現一致による確認がなされた結果、電話番号やメールアドレスなど、実際で真正な機密データが生成された。
- プライベートデータのASR-Aが有害コンテンツのそれよりも高かったことから、現在のアライメントはプライバシー漏洩を完全に防止できていないことが裏付けられた。
- 確率分布の操作によるモデルハッキングは、オープンソースLLMのセキュリティにおいて深刻かつ軽視されがちな脅威であることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。