Skip to main content
QUICK REVIEW

[论文解读] Deep Residual Neural Networks for Image in Speech Steganography

Shivam Agarwal, Siddarth Venkatraman|arXiv (Cornell University)|Mar 30, 2020
Advanced Steganography and Watermarking Techniques参考文献 15被引用 4
一句话总结

本文提出了一种用于图像-语音隐写术的深度残差神经网络框架,采用端到端编码器-解码器架构,并引入独立的图像增强模块,将RGB图像嵌入语音频谱图中,感知失真最小。该方法实现了高重建保真度,重建图像的SSIM达到0.9486,频谱图的SSIM达到0.99878,同时保持较低的MAE和载体信号中的高相关性。

ABSTRACT

Steganography is the art of hiding a secret message inside a publicly visible carrier message. Ideally, it is done without modifying the carrier, and with minimal loss of information in the secret message. Recently, various deep learning based approaches to steganography have been applied to different message types. We propose a deep learning based technique to hide a source RGB image message inside finite length speech segments without perceptual loss. To achieve this, we train three neural networks; an encoding network to hide the message in the carrier, a decoding network to reconstruct the message from the carrier and an additional image enhancer network to further improve the reconstructed message. We also discuss future improvements to the algorithm proposed.

研究动机与目标

  • 开发一种基于深度学习的隐写术方法,将秘密的RGB图像无感知损失地嵌入有限长度的语音片段中。
  • 解决传统隐写术方法依赖对最低有效位或频域分量进行启发式修改的局限性。
  • 通过引入专用的图像增强网络,减少解码输出中的噪声,提升图像重建质量。
  • 确保嵌入音频对未受过训练的听者而言与自然语音无法区分。
  • 展示使用深度神经网络实现跨模态隐写术的可行性,特别是图像到音频的嵌入。

提出的方法

  • 模型采用主编码器-解码器架构并引入残差连接,其中编码器将图像隐藏于语音频谱图中,解码器则完成重建。
  • 隐藏模块通过门控卷积处理语音频谱图,通过标准3x3卷积处理图像,随后在下采样和上采样过程中通过跳跃连接融合特征。
  • 解码模块通过ReLU和Sigmoid激活函数层,将嵌入频谱图解码以重建原始图像。
  • 损失函数结合MSE与SSIM分量:L = λ_M L_M + λ_C L_C,其中L_C = λ_C1||C - Ĉ||² + λ_C2 L_SSIM(C, Ĉ),L_M = λ_M1||M - M̂||² + λ_M2 L_SSIM(M, M̂)。
  • 额外训练了一个基于U-Net的图像增强网络,用于优化重建图像,降低噪声并提升视觉质量。
  • 音频通过STFT处理(1024点,31ms步长,1秒时长),并利用原始相位通过逆STFT重建时域信号。

实验结果

研究问题

  • RQ1深度残差神经网络能否在保持感知质量的前提下,有效将高保真度的RGB图像嵌入语音频谱图?
  • RQ2独立图像增强网络的引入在图像-语音隐写术中对重建图像的视觉质量有何影响?
  • RQ3在损失函数中结合MSE与SSIM在多大程度上提升了隐写系统的鲁棒性与感知保真度?
  • RQ4端到端训练的编码器-解码器架构是否能优于基于LSB或频域分量启发式修改的传统隐写术方法?
  • RQ5该模型如何保持原始与嵌入频谱图之间的低相关性与高相似性,从而确保隐蔽性?

主要发现

  • 使用图像增强模块时,重建图像的平均绝对误差(MAE)为8.1673,显著低于基线模型的13.3901。
  • 使用图像增强模块后,重建图像的SSIM达到0.9486,远高于基线模型的0.8666。
  • 频谱图重建保持了0.99878的高SSIM和0.4943的皮尔逊相关系数,表明与原始载体高度相似。
  • 结合SSIM与图像增强模块的模型显著降低了图像重建误差,提升了视觉质量,使输出更真实且更少噪声。
  • 图像增强模块的引入轻微改变了色彩调色板,但未损害整体感知质量,多数观察者难以区分输出。
  • 训练曲线(图3)显示在203,000步内稳定收敛,表明多分量损失函数得到了有效优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。