Skip to main content
QUICK REVIEW

[論文レビュー] Provably Secure Generative Linguistic Steganography

Siyu Zhang, Zhongliang Yang|arXiv (Cornell University)|Jun 3, 2021
Advanced Steganography and Watermarking Techniques参考文献 30被引用数 7
ひとこと要約

本稿では、事前学習済み言語モデルからのトークンの確率に基づく適応的動的グループ化を用いて、テキストに秘密データを埋め込む、証明可能に安全な生成的言語的ステガノグラフィー手法ADGを提案する。この手法は、自然なテキストと統計的に区別不能であり、ほぼ完全な不可検知性と高い埋め込み容量を達成しており、数学的証明による安全性と、3つのコーパスにおける強固な実験的結果を示している。

ABSTRACT

Generative linguistic steganography mainly utilized language models and applied steganographic sampling (stegosampling) to generate high-security steganographic text (stegotext). However, previous methods generally lead to statistical differences between the conditional probability distributions of stegotext and natural text, which brings about security risks. In this paper, to further ensure security, we present a novel provably secure generative linguistic steganographic method ADG, which recursively embeds secret information by Adaptive Dynamic Grouping of tokens according to their probability given by an off-the-shelf language model. We not only prove the security of ADG mathematically, but also conduct extensive experiments on three public corpora to further verify its imperceptibility. The experimental results reveal that the proposed method is able to generate stegotext with nearly perfect security.

研究の動機と目的

  • 既存の生成的言語的ステガノグラフィー手法が、言語モデルの確率分布に統計的歪みをもたらすというセキュリティ上の脆弱性を是正すること。
  • ステゴテキストが自然なテキストと統計的に区別不能であることを保証することで、統計的ステガノグラフィー解析に対して耐性を持つこと。
  • 自然なテキストの流れや不可検知性を損なわず、高い埋め込み容量を達成すること。
  • 提案手法の安全性を情報理論的基準に基づいて数学的に証明すること。
  • 不可検知性、埋め込み容量、ステガノグラフィー解析に対する耐性の観点から、複数の公開テキストコーパスにおける手法の実験的妥当性を検証すること。

提案手法

  • ADGは、事前学習済み言語モデルからの条件付き確率に基づき、各生成段階でトークンの適応的動的グループ化を実行する。
  • 秘密情報は、言語モデルの全体的な確率分布を保持するように、グループ化されたトークン集合から選択することで埋め込む。
  • トークンの確率に応じてグループ化を動的に調整することで、自然なテキストからの統計的ずれを最小限に抑える。
  • 埋め込みプロセスは情報理論的解析を用いて形式的に証明されており、ステゴテキストの分布が言語モデル下で自然なテキストと区別不能であることを示している。
  • 抽出プロセスは決定論的かつ損失なしであり、グループ化戦略と言語モデルの共有知識に依存する。
  • 微調整を必要とせず、既存の事前学習済み言語モデルを活用するため、互換性と効率性が確保される。

実験結果

リサーチクエスチョン

  • RQ1統計的ステガノグラフィー解析に対して数学的に証明可能な安全性を有する生成的言語的ステガノグラフィー手法は構築可能か?
  • RQ2言語モデルの確率に基づくトークンの適応的動的グループ化は、ステゴテキストにおける統計的歪みを低減するか?
  • RQ3自然なテキストの流れや不可検知性を損なわず、高い埋め込み容量を達成可能か?
  • RQ4提案手法は、KLD、検出精度、有効埋め込みレートの観点から、既存のベースラインと比較してどのように差をつけるか?
  • RQ5多様なコーパスにおいて、ステゴテキストは統計的に自然なテキストと区別不能か?

主な発見

  • ADGはKLD1値が0に非常に近く、言語モデルの自然な分布に対する歪みが最小限であることを示している。
  • KLD2の結果から、ステゴテキストが自然なテキストと統計的に整合していることが確認され、強い情報理論的セキュリティが裏付けられた。
  • すべてのコーパスにおいて、ステガノグラフィー解析モデルの検出精度がほぼ0.5にとどまり、高い不可検知性が裏付けられた。
  • ADGの有効埋め込みレート(EER)は、すべてのベースラインを大きく上回っており、安全性を維持したまま強力な容量を実現していることが示された。
  • 表5の定性的な例から、生成されたステゴテキストが流暢で文法的に正しい、意味的に整合性のあるものであることが確認された。
  • ADGは、埋め込み容量と不可検知性の両面で、すべてのベースラインを上回っており、EERおよびKLD指標において包括的な性能優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。