[論文レビュー] An Unforgeable Publicly Verifiable Watermark for Large Language Models
本稿では、大規模言語モデル向けの、初めての偽造不可能で公開検証可能なウォーターマーキング方式を提案する。この方式は、ウォーターマーキングの生成と検出を別個のニューラルネットワークで行い、トークン埋め込みを共有することで検出効率を向上させる。秘密鍵を必要とせず、ほぼ完全な検出F1スコア(約99%)を達成しており、検出ネットワークを逆方向に解読する計算的非対称性のおかげで、偽造試行に対して強い耐性を示す。
Recently, text watermarking algorithms for large language models (LLMs) have been proposed to mitigate the potential harms of text generated by LLMs, including fake news and copyright issues. However, current watermark detection algorithms require the secret key used in the watermark generation process, making them susceptible to security breaches and counterfeiting during public detection. To address this limitation, we propose an unforgeable publicly verifiable watermark algorithm named UPV that uses two different neural networks for watermark generation and detection, instead of using the same key at both stages. Meanwhile, the token embedding parameters are shared between the generation and detection networks, which makes the detection network achieve a high accuracy very efficiently. Experiments demonstrate that our algorithm attains high detection accuracy and computational efficiency through neural networks. Subsequent analysis confirms the high complexity involved in forging the watermark from the detection network. Our code is available at \href{https://github.com/THU-BPM/unforgeable_watermark}{https://github.com/THU-BPM/unforgeable\_watermark}. Additionally, our algorithm could also be accessed through MarkLLM \citep{pan2024markllm} \footnote{https://github.com/THU-BPM/MarkLLM}.
研究の動機と目的
- 秘密鍵に依存する既存のウォーターマーキング方式の脆弱性、特に公開検出環境下で秘密鍵が露呈・悪用されるリスクを解消すること。
- 秘密鍵の暴露を防ぎつつ、公開検証が可能なウォーターマーキングシステムを設計すること。
- 生成ネットワークと検出ネットワーク間でトークン埋め込みパラメータを共有することで、検出精度を向上させつつ、トレーニングコストを最小限に抑えること。
- 実際の条件下で、検出ネットワークからウォーターマーキングルールを逆引きすることは計算的に非現実的であることを実証的に示すこと。
- 高いテキスト品質を維持しつつ、強力な検出性能と一般的な攻撃戦略に対して耐性を持つこと。
提案手法
- ウォーターマーキング生成器は、LLMのログティトをもとに、サイズ$ w $のスライディングウィンドウの最後のトークンに対して、小さなニューラルネットワークを用いてウォーターマーキング信号を予測する。
- ウォーターマーキング検出器は、別個の軽量ニューラルネットワークを用い、全系列を入力として受け取り、ウォーターマーキングの存在を二値で出力する。
- 生成器と検出器の両ネットワーク間でトークン埋め込みパラメータを共有することで、事前知識を提供し、トレーニングコストを最小限に抑えながら検出精度を向上させる。
- ウォーターマーキング信号は、学習済みのzスコアベースのメカニズムを用いて、特定のトークンのログティトを調整することで埋め込む。ウォーターマーキングラベルは、トークン確率のzスコアの閾値に基づいて決定される。
- 計算的非対称性を活用する:検出器から生成器を学習することは、逆方向に比べてはるかに困難であり、偽造が非現実的になる。
- ウォーターマーキングの強度を制御するパラメータ$ \ u $を用い、検出性能とテキスト品質(パープレキシティで測定)のバランスを取る。

実験結果
リサーチクエスチョン
- RQ1公開検証が可能であるが、秘密鍵を露呈しないウォーターマーキング方式を設計できるか?
- RQ2公開利用可能な検出モデルから、ウォーターマーキングルールを逆引きすることは計算的に非現実的か?
- RQ3生成と検出ネットワーク間で埋め込みを共有することで、検出精度が向上し、かつ偽造不可能性が損なわれないか?
- RQ4リバーストレーニングや語彙頻度分析といった一般的な攻撃戦略に対して、ウォーターマーキング方式はどのように性能を示すか?
- RQ5ウォーターマーキング強度パラメータ$ \ u $の関数として、検出性能と生成テキスト品質(例:パープレキシティ)のトレードオフはどのようなものか?
主な発見
- 提案されたウォーターマーキング検出ネットワークは、秘密鍵ベース手法の理論的上限にほぼ達するF1スコア(約99%)を達成した。
- ウォーターマーキングはリバーストレーニング攻撃に対しても強く、ウィンドウサイズが小さな閾値を超えると、成功確率が0.5(ランダム推測)に低下した。
- 語彙頻度に基づくクラッキング手法は、ウィンドウサイズが非常に小さい場合を除き効果を示さず、統計的解析に対する耐性が確認された。
- ウォーターマーキング生成ネットワークは、標準偏差が0.02未満の安定した水色付きトークン比を維持しており、信頼性の高いzスコア計算が可能である。
- ウォーターマーキングの計算オーバーヘッドは最小限であり、Tesla V100 GPU上でも、大規模モデルで1トークンあたりわずか~1msの追加時間を要する。
- LLaMA-7Bモデルにおけるパープレキシティ測定で、F1スコアが高くかつテキスト品質が妥当な水準を維持できるため、$ \ u $ = 2が最適とされた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。