Skip to main content
QUICK REVIEW

[論文レビュー] Generating Steganographic Text with LSTMs

Tina Fang, Martin Jaggi|arXiv (Cornell University)|May 30, 2017
Authorship Attribution and Profiling参考文献 18被引用数 12
ひとこと要約

本稿では、長短期記憶(LSTM)ネットワークを用いて、自然言語内に暗号化されたメッセージを隠す高品質なステガノグラフィックテキストを生成する、新しいニューラルステガノグラフィックシステムを提案する。学習済み語彙内でのトークン・ビンへの秘密ビットブロックのマッピングにより、LSTMは2語あたり最大2ビットの容量を実現する自然な言語的出力を生成する。これは、先行する最先端手法を著しく上回る。

ABSTRACT

Motivated by concerns for user privacy, we design a steganographic system ("stegosystem") that enables two users to exchange encrypted messages without an adversary detecting that such an exchange is taking place. We propose a new linguistic stegosystem based on a Long Short-Term Memory (LSTM) neural network. We demonstrate our approach on the Twitter and Enron email datasets and show that it yields high-quality steganographic text while significantly improving capacity (encrypted bits per word) relative to the state-of-the-art.

研究の動機と目的

  • 暗号化されていないメッセージに基づくターゲティング広告に依存する通信プラットフォームにおける監視によるプライバシーのリスクに対処すること。
  • 既存のカバーモディフィケーションステゴシステムの限界、特に低容量と不自然な言語的出力という問題を克服すること。
  • 高品質で人間らしく自然なステガノテキストを生成するニューラルネットワークベースのステガノグラフィックシステムを開発すること。
  • 受動的な敵対者によるメッセージ通信の監視を引き起こさずに、2名の参加者間で安全かつ検出不能な通信を可能にすること。

提案手法

  • 共有鍵を用いて語彙を 2^{|B|} 個の互いに素なビンに分割し、各ビンは長さ |B| の固有のビットブロックに対応する。
  • 改変された単語レベルのLSTMを、現在のビットブロックに対応するビンからのみ選択可能な制約付きで訓練し、テキストをトークン単位で生成する。
  • 秘密データは圧縮され、固定長のビットブロックに分割され、その後ビンマップされたトークン選択によりステガノテキストに埋め込まれる。
  • 文脈的整合性を長文や段落にわたって維持するため、大規模なデータセット(TwitterおよびEnronメール)を用いてモデルを訓練する。
  • ビンの数を調整し、必要に応じて共通トークンを追加することで、容量と品質の間で柔軟なトレードオフを実現できる。
  • 手動による後処理は一切施さず、ステガノテキストはLSTMによって直接生成される。これは、マトリョーシカ風の人間補助システムとは明確に異なる。

実験結果

リサーチクエスチョン

  • RQ1LSTMベースの言語モデルは、言語的に自然でかつ高容量最適化されたステガノグラフィックテキストを生成できるか?
  • RQ2提案されたステガノグラフィックシステムの容量は、既存のカバーモディフィケーションおよびニューラルステガノグラフィー手法と比べてどの程度か?
  • RQ3ビン制約の下でも、長文にわたって文脈的整合性と文法的正しさをどの程度保持できるか?
  • RQ4人間または自動評価によって判断された際、知覚的品質を損なわずに高容量を達成できるか?
  • RQ5特に既存のステゴシステムと比較して、ステガノグラフィー解析ツールや人間の審査官による検出をどれほど耐性があるか?

主な発見

  • 提案されたLSTMベースのステガノグラフィックシステムは、1ツイートあたり32ビット(約2ビット/語)の容量を達成しており、最先端のCoverTweetシステム(1ツイートあたり2.8ビット)を11倍以上上回る。
  • 生成されたステガノテキストは高い言語的品質を維持しており、例として文法的正しさや人間のツイートと同等の自然さが確認された。
  • 最大4ビンの状況でも、文と段落にわたる文脈的一致性が保持されており、ビン制約に対するモデルの頑健性が示された。
  • システムは容量と品質の間で柔軟なトレードオフを可能にしている:ビンの数を増やすことで容量を向上させられ、ビンを減らして共通トークンを追加することで文のなめらかさ(フレーズ感)が向上する。
  • これらのシステムは、利用可能な変換オプションの数に制限される既存のカバーモディフィケーションシステムよりも、容量面で優れている。
  • 予備的な結果では、システムが人間の審査官に対して検出困難である可能性が示唆されたが、今後の研究で正式な評価を計画している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。