Skip to main content
QUICK REVIEW

[論文レビュー] Heard More Than Heard: An Audio Steganography Method Based on GAN

Dengpan Ye, Shunzhi Jiang|arXiv (Cornell University)|Jul 11, 2019
Advanced Steganography and Watermarking Techniques参考文献 14被引用数 18
ひとこと要約

本稿では、人為的な埋め込みルールに依存せず、最小限の知覚可能な歪みで秘密音声をキャリア音声に埋め込むGANベースの音声ステガノグラフィー手法を提案する。敵対的フレームワーク内でエンコーダ、デコーダ、ディスクラミネーターを同時に訓練することで、外部のステガノグラフィー解析器による検出を効果的に回避する高精度なステガノグラフィック音声を実現し、従来の手作業で設計された手法に比べて耐性とセキュリティの面で優れている。

ABSTRACT

Audio steganography is a collection of techniques for concealing the existence of information by embedding it within a non-secret audio, which is referred to as carrier. Distinct from cryptography, the steganography put emphasis on the hiding of the secret existence. The existing audio steganography methods mainly depend on human handcraft, while we proposed an audio steganography algorithm which automatically generated from adversarial training. The method consists of three neural networks: encoder which embeds the secret message in the carrier, decoder which extracts the message, and discriminator which determine the carriers contain secret messages. All the networks are simultaneously trained to create embedding, extracting and discriminating process. The system is trained with different training settings on two datasets. Competed the majority of audio steganographic schemes, the proposed scheme could produce high fidelity steganographic audio which contains secret audio. Besides, the additional experiments verify the robustness and security of our algorithm.

研究の動機と目的

  • 手作業で設計された埋め込みルールに依存しない自動音声ステガノグラフィー手法の開発を目的とする。
  • 外部のステガノグラフィー解析器を模倣するディスクラミネーターを用いた敵対的訓練により、ステガノグラフィック音声の品質と知覚不能性を向上させる。
  • チャネルノイズに対する耐性を高め、独立したステガノグラフィー解析ツールに対するセキュリティを強化する。
  • 人為的に設計された特徴を用いずに、GANを用いてエンドツーエンドのステガノグラフィック埋め込みと抽出を学習する可能性を示す。

提案手法

  • モデルは、3つの構成要素(エンコーダ、デコーダ、ディスクラミネーター)を備えたGANフレームワークを採用する。エンコーダは秘密音声をキャリア音声に埋め込み、デコーダはステガノグラフィック音声から秘密音声を復元する。
  • エンコーダとデコーダは、再構成損失とディスクラミネーターからの敵対的損失を含む結合損失関数を用いてエンドツーエンドで訓練される。
  • ディスクラミネーターは、本物のキャリア音声とステガノグラフィック音声を識別するように訓練され、エンコーダがより現実的で検出されにくいステガノグラフィック出力を生成するよう強制する。
  • 訓練プロセスは敵対的最適化を含み、エンコーダはディスクラミネーターをだませるように、デコーダはステガノグラフィック音声から元の秘密音声を再構成できるように学習する。
  • 耐性評価のため、NOR(通常訓練)とAN(ノイズ注入を伴う敵対的訓練)の2つの訓練設定を評価する。
  • 知覚的類似性と信号の忠実度を評価するために、スペクトログラムと信号指標(MSE、SNR)が用いられる。

実験結果

リサーチクエスチョン

  • RQ1人為的に設計された埋め込みルールがなくても、GANベースのフレームワークが有効な音声ステガノグラフィーを自動で学習できるか?
  • RQ2本手法は、秘密メッセージを埋め込む際、音声の忠実度をどれほど保っているか?
  • RQ3ノイズの多いチャネル環境下でも、モデルは高い秘密復元精度を維持できるか?
  • RQ4SRM や CNNベースのステガノグラフィー解析器といった独立した解析ツールに対して、本モデルの有効性はどの程度か?

主な発見

  • 提案されたGANベースのステガノグラフィー手法は、キャリア音声とステガノグラフィック音声のスペクトログラムがほぼ同一であることを示し、最小限の知覚的歪みで高精度なステガノグラフィック音声を達成した。
  • AN訓練設定下で、TIMITデータセット上での秘密信号損失MSEは0.0002、SNRは1.9642に達し、60 dBのガウスノイズ下でも堅牢な復元性能を示した。
  • TIMITデータセット上、SRMステガノグラフィー解析器に対して91.56%、CNNベースのステガノグラフィー解析器に対して92.58%の精度を達成し、検出に対する強い耐性を示した。
  • AN訓練戦略によりノイズ耐性が向上し、NOR設定と比較して秘密信号損失が低く抑えられ、より高いSNRを維持した。NOR設定ではノイズ下で性能が劣化した。
  • 両方のステガノグラフィー解析器およびデータセットにおいて、ベースライン手法HCMとECCSに比べ、検出精度が低く抑えられ、ステガノグラフィー耐性が優れていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。