Skip to main content
QUICK REVIEW

[論文レビュー] Spec-ResNet: A General Audio Steganalysis scheme based on Deep Residual Network of Spectrogram

Yanzhen Ren, Dengkai Liu|arXiv (Cornell University)|Jan 21, 2019
Digital Media Forensic Detection参考文献 37被引用数 17
ひとこと要約

本稿では、スペクトログラムを入力とし、AACおよびMP3音声における複数の埋め込みドメインで情報隠しを検出するための汎用音声ステガノグラフィー分析フレームワーク、Spec-ResNetを提案する。マルチスケールのスペクトログラム窓を用いて普遍的なステガノグラフィー特徴を捉え、残差学習を活用することで、従来の手作業による特徴量やCNNベースの手法を上回る最先端の検出精度を達成した。AACおよびMP3Stegoスキームにおいて、優れた性能を発揮した。

ABSTRACT

The widespread application of audio and video communication technology make the compressed audio data flowing over the Internet, and make it become an important carrier for covert communication. There are many steganographic schemes emerged in the mainstream audio compression data, such as AAC and MP3, followed by many steganalysis schemes. However, these steganalysis schemes are only effective in the specific embedded domain. In this paper, a general steganalysis scheme Spec-ResNet (Deep Residual Network of Spectrogram) is proposed to detect the steganography schemes of different embedding domain for AAC and MP3. The basic idea is that the steganographic modification of different embedding domain will all introduce the change of the decoded audio signal. In this paper, the spectrogram, which is the visual representation of the spectrum of frequencies of audio signal, is adopted as the input of the feature network to extract the universal features introduced by steganography schemes; Deep Neural Network Spec-ResNet is well-designed to represent the steganalysis feature; and the features extracted from different spectrogram windows are combined to fully capture the steganalysis features. The experiment results show that the proposed scheme has good detection accuracy and generality. The proposed scheme has better detection accuracy for three different AAC steganographic schemes and MP3Stego than the state-of-arts steganalysis schemes which are based on traditional hand-crafted or CNN-based feature. To the best of our knowledge, the audio steganalysis scheme based on the spectrogram and deep residual network is first proposed in this paper. The method proposed in this paper can be extended to the audio steganalysis of other codec or audio forensics.

研究の動機と目的

  • AAC や MP3 などの圧縮音声フォーマットにおける多様な埋め込みドメインにわたり、ステガノグラフィーを検出可能な汎用的なステガノグラフィー分析フレームワークの開発を目的とする。
  • 特定の埋め込みドメインでのみ有効な従来のステガノグラフィー分析手法の限界を克服することを目的とする。
  • 音声信号における微細なステガノグラフィー変更を捉えるために、スペクトログラムを普遍的な表現として用いることの可能性を検討することを目的とする。
  • 深層残差ネットワークを活用し、スペクトログラム表現から弱いステガノグラフィー特徴を効果的に抽出することを目的とする。
  • 異なるスペクトログラム窓サイズからのマルチスケール特徴の統合を通じて、検出精度を向上させることを目的とする。

提案手法

  • 本手法は、音声周波数成分の可視化としてのスペクトログラムを、深層ニューラルネットワークの入力として用い、圧縮音声内のスペクトル時間的関係を捉える。
  • 深層残差ネットワーク(ResNet)を用いて階層的なステガノグラフィー特徴を学習し、深層構造にありがちな消失勾配問題を軽減する。
  • 複数の窓サイズ(N=512, 1024, 2048)からのスペクトログラムを処理することでマルチスケール特徴を抽出し、それらを統合して検出性能を向上させる。
  • CDB_MP3 および SDB_MP3 データセットの1500個の音声サンプルから得たスペクトログラムを用いて学習を行い、データ漏洩を避けるために訓練用およびテスト用のデータセットを別々に用意した。
  • 交差エントロピー損失を用いてエンドツーエンドで学習し、学習率の減少を伴う確率的勾配降下法で最適化した。
  • 複数の窓サイズからの予測を統合することで、より頑健で高精度な混合分類モデルを構築した。

実験結果

リサーチクエスチョン

  • RQ1スペクトログラムは、異なる音声圧縮ドメインにわたり、ステガノグラフィー検出のための普遍的特徴表現として機能することができるか?
  • RQ2深層残差ネットワークは、圧縮音声信号における微細なステガノグラフィー歪みを効果的に学習できるか?
  • RQ3異なるスペクトログラム窓サイズからのマルチスケール特徴統合は、単一スケール解析と比較して、ステガノグラフィー検出精度を向上させるか?
  • RQ4提案手法であるSpec-ResNetは、AACおよびMP3のステガノグラフィースキームにおいて、最先端のステガノグラフィー分析手法と比較して、精度および一般化性能の面で優れているか?
  • RQ5本手法は、ステガノグラフィー分析を超えた他の音声コーデックやフォレンジック応用にも一般化可能か?

主な発見

  • Spec-ResNetは、N=1024の窓サイズを用いた混合モデルで、MP3Stegoに対して0.9993の検出精度を達成し、Wang [25](0.9250)およびLuo [32](0.9786)を大きく上回った。
  • AACのステガノグラフィーにおいては、3つのスケーム(LSB-EE, MIN, SIGN)の平均検出精度が0.8829に達し、先行する最先端手法を上回った。
  • N=1024の窓サイズを用いたモデルは、MP3Stegoで100%の真正陽性率(TPR)および99.87%の真正陰性率(TNR)を達成し、ほぼ完璧な検出性能を示した。
  • 複数の窓サイズからの予測を統合した混合モデルは、最高の精度(0.9993)を達成し、マルチスケール特徴統合の有効性を示した。
  • AACのLSB-EEスケームでは、Spec-ResNetが0.9531の検出精度を達成し、次に優れた手法(0.8819)を7ポイント以上上回った。
  • 著者らの知る限り、本稿は、音声ステガノグラフィー分析においてスペクトログラムと深層残差ネットワークを組み合わせた最初の公開研究であり、分野における新たなベンチマークを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。