Skip to main content
QUICK REVIEW

[論文レビュー] Language Model Inversion

John X. Morris, Wenting Zhao|arXiv (Cornell University)|Nov 22, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、次トークン確率分布から隠しプロンプトを回復するための新規手法を紹介する。微調整されたエンコーダデコーダモデルを用いて入力テキストを再構築する。Llama-2 7Bでは、BLEUスコア59およびトークンレベルのF1スコア78%を達成し、テキストのみの出力やトップ-K確率など制限されたアクセス環境下でも、27%のプロンプトを正確に回復する。

ABSTRACT

Language models produce a distribution over the next token; can we use this information to recover the prompt tokens? We consider the problem of language model inversion and show that next-token probabilities contain a surprising amount of information about the preceding text. Often we can recover the text in cases where it is hidden from the user, motivating a method for recovering unknown prompts given only the model's current distribution output. We consider a variety of model access scenarios, and show how even without predictions for every token in the vocabulary we can recover the probability vector through search. On Llama-2 7b, our inversion method reconstructs prompts with a BLEU of $59$ and token-level F1 of $78$ and recovers $27\%$ of prompts exactly. Code for reproducing all experiments is available at http://github.com/jxmorris12/vec2text.

研究の動機と目的

  • 言語モデルの次トークン確率分布が、元の入力プロンプトを再構築するのに十分な情報を漏洩させているかどうかを調査すること。
  • 完全な確率情報が得られない状況でも、部分的または間接的な確率アクセスが可能な場合に、言語モデル出力を逆方向に処理して隠しプロンプトを回復する手法を開発すること。
  • 全確率ベクトル、トップ-K出力、離散的テキスト生成を含む多様なアクセスパターンにおけるプロンプト回復の耐性を評価すること。
  • 同じモデルファミリー内(例:Llama-2 と Llama-chat)の異なる言語モデルアーキテクチャ間での逆方向推定モデルの汎用性を評価すること。
  • プライベート情報(例:名前、日付、国籍)がプロンプト逆方向推定プロセス中にどの程度保持されたり漏洩したりするかを測定すること。

提案手法

  • 2段階の逆方向推定フレームワークを提案:まず、次トークン確率ベクトルを密度ベクトルとして表現し、次に微調整されたエンコーダデコーダトランスフォーマーを用いてこのベクトルを自然言語プロンプトに変換する。
  • 再構築損失を用いて、合成されたプロンプト-確率ペアのデータセット上で逆方向推定モデルを学習し、元のプロンプトと再構築されたプロンプトの差を最小化する。
  • 全確率アクセス、トップ-K確率の取得、反復的クエリによる離散的テキスト生成を模擬することで、多様なアクセス制約下での逆方向推定を可能にする。
  • 部分的な出力しか得られない場合に、反復的クエリに基づく確率推定を用いて欠落した確率成分を再構築する。
  • 転移学習を活用し、あるモデル(例:Llama-2 7B)で学習した逆方向推定モデルを、同じファミリー内(例:Llama-chat 7B)の別のモデルに適用する。
  • 名前、日付、国籍を含む合成プロンプトで微調整することで、プライベート属性の回復に逆方向推定手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルの次トークン確率分布は、高い忠実度で元の入力プロンプトを再構築できるほど十分な情報を漏洩させているか?
  • RQ2全確率ベクトルが得られない状況(例:離散的テキスト出力やトップ-K確率の観測のみ)において、プロンプト逆方向推定はどの程度有効か?
  • RQ3名前、日付、国籍などのプライベート情報は、逆方向推定プロセス中にどの程度保持され、漏洩するか?
  • RQ4Llama-2 と Llama-chat のような同じアーキテクチャファミリー内の異なるモデル間でも、逆方向推定手法は一般化可能か?
  • RQ5強化学習による人間の価値基準に合わせた調整(RLHF)が導入された状況下でも、テキストベースのジャイルブレイク攻撃と比較して、逆方向推定の性能はどの程度維持されるか?

主な発見

  • Llama-2 7Bでは、逆方向推定手法がBLEUスコア59およびトークンレベルのF1スコア78%を達成し、入力プロンプトの高品質な再構築を実現した。
  • プロンプトがユーザーに直接表示されていなくても、27%のプロンプトを正確に回復できた。
  • synthbioデータセットにおいて、国や国籍といったプライベート属性は、それぞれ87.2%および64.5%の正確一致精度で再構築された。
  • 個別の日付や年については再構築精度が著しく低下し、synthbioデータセットでは年が1.0%の精度にまで低下した。
  • 離散的テキスト出力しか得られない状況でも、反復的クエリにより十分な確率推定が可能となり、逆方向推定が有効に機能した。
  • 逆方向推定手法は、RLHFによるアライメント技術に対しても耐性を示したが、テキストベースのジャイルブレイク攻撃はしばしば同様のアライメント戦略によって抑制される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。