Skip to main content
QUICK REVIEW

[論文レビュー] TS-CNN: Text Steganalysis from Semantic Space Based on Convolutional Neural Network

Zhongliang Yang, Nan Wei|arXiv (Cornell University)|Oct 18, 2018
Advanced Steganography and Watermarking Techniques参考文献 25被引用数 20
ひとこと要約

本稿では、隠し情報の検出を目的として、変調埋め込み前後の高次意味的空間における微細な分布シフトを分析するため、畳み込みニューラルネットワーク(CNN)を活用したテキストステガノグラフィー解析手法TS-CNNを提案する。本モデルは、新たに収集されたCT-Stegデータセット上で、ほぼ100%の精度と再現率を達成し、70%以上の精度で隠し情報の容量を推定できる。

ABSTRACT

Steganalysis has been an important research topic in cybersecurity that helps to identify covert attacks in public network. With the rapid development of natural language processing technology in the past two years, coverless steganography has been greatly developed. Previous text steganalysis methods have shown unsatisfactory results on this new steganography technique and remain an unsolved challenge. Different from all previous text steganalysis methods, in this paper, we propose a text steganalysis method(TS-CNN) based on semantic analysis, which uses convolutional neural network(CNN) to extract high-level semantic features of texts, and finds the subtle distribution differences in the semantic space before and after embedding the secret information. To train and test the proposed model, we collected and released a large text steganalysis(CT-Steg) dataset, which contains a total number of 216,000 texts with various lengths and various embedding rates. Experimental results show that the proposed model can achieve nearly 100\% precision and recall, outperforms all the previous methods. Furthermore, the proposed model can even estimate the capacity of the hidden information inside. These results strongly support that using the subtle changes in the semantic space before and after embedding the secret information to conduct text steganalysis is feasible and effective.

研究の動機と目的

  • 従来の統計的手法では検出困難な、自然言語におけるカバーレスステガノグラフィーの増加する課題に対処すること。
  • テキスト内の微細な意味的分布シフトを同定することで、ステガノグラフィックコンテンツを検出する深層学習ベースのアプローチを開発すること。
  • 216,000件のテキストを含み、長さや埋め込みレートが変動する大規模かつ公開可能なデータセット(CT-Steg)を構築し、堅牢な学習と評価を可能にすること。
  • ステガノグラフィックテキストの検出に加え、それらに埋め込まれた隠し情報の容量の推定を可能にすること。

提案手法

  • 手動による特徴工学を伴わず、入力テキストから高次意味的特徴を自動的に抽出するため、畳み込みニューラルネットワーク(CNN)を活用する。
  • 抽出された意味的特徴を高次元の意味的空間にマッピングし、分布分析を実施する。
  • カバーテキストとステガテキストの意味的空間分布における微細な統計的差異を同定することで、ステガノグラフィーを検出する。
  • t-SNE可視化を適用し、意味的空間内での埋め込み率ごとにテキストがクラスタリングされることを確認し、検出可能な分布シフトを裏付ける。
  • 埋め込み率が0%から25%までのテキストを含むCT-Stegデータセット上で、モデルを学習および評価する。
  • 局所的およびグローバルな意味的変化を両方捉えるために、マルチスケール特徴抽出戦略(TS-CNN (Multi))とグローバル意味的モデリングのバリエーション(TS-CNN (Single))を実装する。

実験結果

リサーチクエスチョン

  • RQ1手作業による言語的特徴に依存せずに、深層意味的表現学習がテキスト内のステガノグラフィックコンテンツを効果的に検出できるか?
  • RQ2自然言語テキストにおいて、隠し情報の埋め込みレベルが変化するに従い、意味的空間分布はどのように変化するか?
  • RQ3カバーレスステガノグラフィーの文脈において、深層学習モデルが高精度・高再現率でステガノグラフィックテキストを検出できるか、その程度はいかほどか?
  • RQ4意味的空間分布のパターンに基づいて、隠し情報の埋め込みレートを推定できるか?
  • RQ5提案手法は、多様なテキスト長さや意味的構造に対して、頑健であるか?

主な発見

  • TS-CNNは、CT-Stegデータセット上でほぼ100%の精度と再現率を達成し、これまでのあらゆるテキストステガノグラフィー解析手法を大きく上回っている。
  • 本モデルは、低埋め込みレートでも、ステガノグラフィック埋め込みによって引き起こされる高次元意味的空間内での微細な意味的分布シフトを効果的に検出できる。
  • t-SNE可視化により、同じ埋め込みレートを持つステガテキストが意味的空間内でクラスタリングされ、埋め込み率が上昇するに従いカバーテキストと明確に分離することが確認された。
  • 本モデルは、隠し情報の容量を70%以上の精度で推定でき、これはあらゆる先行研究に見られない能力である。
  • TS-CNN (Multi)は文単位の意味的特徴に注目する一方、TS-CNN (Single)は文間の整合性を重視しており、両者とも堅牢な検出に貢献している。
  • 結果から、意味的空間分布の差異が、現代のカバーレスステガノグラフィーにおけるステガノグラフィー解析に信頼性があり効果的なシグナルであることが検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。