Skip to main content
QUICK REVIEW

[论文解读] Heard More Than Heard: An Audio Steganography Method Based on GAN

Dengpan Ye, Shunzhi Jiang|arXiv (Cornell University)|Jul 11, 2019
Advanced Steganography and Watermarking Techniques参考文献 14被引用 18
一句话总结

本文提出了一种基于生成对抗网络(GAN)的音频隐写方法,能够自动学习将秘密音频嵌入载体音频,同时保持最小的可感知失真。通过在对抗框架中联合训练编码器、解码器和判别器,该模型生成了高保真度的隐写音频,能够有效抵抗外部隐写分析器的检测,在鲁棒性和安全性方面优于传统手工设计的方法。

ABSTRACT

Audio steganography is a collection of techniques for concealing the existence of information by embedding it within a non-secret audio, which is referred to as carrier. Distinct from cryptography, the steganography put emphasis on the hiding of the secret existence. The existing audio steganography methods mainly depend on human handcraft, while we proposed an audio steganography algorithm which automatically generated from adversarial training. The method consists of three neural networks: encoder which embeds the secret message in the carrier, decoder which extracts the message, and discriminator which determine the carriers contain secret messages. All the networks are simultaneously trained to create embedding, extracting and discriminating process. The system is trained with different training settings on two datasets. Competed the majority of audio steganographic schemes, the proposed scheme could produce high fidelity steganographic audio which contains secret audio. Besides, the additional experiments verify the robustness and security of our algorithm.

研究动机与目标

  • 开发一种自动化的音频隐写方法,以减少对人工设计的嵌入规则的依赖。
  • 通过与模拟外部隐写分析器的判别器进行对抗训练,提升隐写音频的质量和不可感知性。
  • 增强对信道噪声的鲁棒性,并提高对独立隐写分析工具的抗御能力。
  • 证明使用生成对抗网络(GAN)端到端学习隐写嵌入与提取过程的可行性,无需人工设计特征。

提出的方法

  • 该模型采用包含三个组件的GAN框架:用于将秘密音频嵌入载体音频的编码器、用于从隐写音频中提取秘密的解码器,以及用于检测隐写内容的判别器。
  • 编码器和解码器通过联合训练,采用包含重建损失和来自判别器的对抗损失的联合损失函数。
  • 判别器被训练以区分真实载体音频与隐写音频,从而迫使编码器生成更逼真、难以被检测的隐写输出。
  • 训练过程采用对抗优化策略:编码器试图欺骗判别器,而解码器则学习从隐写音频中重建原始秘密。
  • 评估了两种训练设置:NOR(正常训练)和AN(注入噪声的对抗训练),以评估模型的鲁棒性。
  • 使用频谱图和信号度量(MSE、SNR)来评估感知相似性和信号保真度。

实验结果

研究问题

  • RQ1基于GAN的框架能否在无需人工设计嵌入规则的情况下自动学习有效的音频隐写?
  • RQ2所提出的方法在嵌入秘密信息的同时,音频保真度如何保持?
  • RQ3在噪声信道条件下,模型能否保持高精度的秘密恢复能力?
  • RQ4该模型在面对独立的隐写分析工具(如SRM和基于CNN的隐写分析器)时,其有效性如何?

主要发现

  • 所提出的基于GAN的隐写方法实现了高保真度的隐写音频,感知失真极小,表现为载体音频与隐写音频的频谱图几乎完全相同。
  • 在AN训练设置下,TIMIT数据集上的秘密损失MSE为0.0002,秘密SNR为1.9642,表明在60 dB高斯噪声下仍具备鲁棒的解码性能。
  • 在TIMIT数据集上,该模型对SRM隐写分析器的准确率为91.56%,对基于CNN的隐写分析器的准确率为92.58%,表明其具有强大的抗检测能力。
  • AN训练策略显著提升了对噪声的鲁棒性,相比NOR设置,秘密损失更低,SNR保持更高,后者在噪声环境下性能明显下降。
  • 与基线方法HCM和ECCS相比,该模型在隐写分析抵抗能力方面表现更优,对两种隐写分析器和数据集的检测准确率均更低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。