Skip to main content
QUICK REVIEW

[论文解读] Exploiting Language Model for Efficient Linguistic Steganalysis

Biao Yi, Hanzhou Wu|arXiv (Cornell University)|Jul 26, 2021
Advanced Steganography and Watermarking Techniques被引用 4
一句话总结

本文提出两种预训练方法——基于语言模型的RNN(LM-RNN)和基于自编码器的RNN(AE-RNN),通过利用伪装文本与载体文本之间词条件概率分布的统计差异,提升语言学隐写分析性能。与随机初始化的RNN相比,该方法显著提高了检测准确率和收敛速度,在正负样本极不平衡(载体文本远多于伪装文本)的情况下也实现了最先进性能。

ABSTRACT

Recent advances in linguistic steganalysis have successively applied CNN, RNN, GNN and other efficient deep models for detecting secret information in generative texts. These methods tend to seek stronger feature extractors to achieve higher steganalysis effects. However, we have found through experiments that there actually exists significant difference between automatically generated stego texts and carrier texts in terms of the conditional probability distribution of individual words. Such kind of difference can be naturally captured by the language model used for generating stego texts. Through further experiments, we conclude that this ability can be transplanted to a text classifier by pre-training and fine-tuning to improve the detection performance. Motivated by this insight, we propose two methods for efficient linguistic steganalysis. One is to pre-train a language model based on RNN, and the other is to pre-train a sequence autoencoder. The results indicate that the two methods have different degrees of performance gain compared to the randomly initialized RNN, and the convergence speed is significantly accelerated. Moreover, our methods achieved the best performance compared to related works, while providing a solution for real-world scenario where there are more cover texts than stego texts.

研究动机与目标

  • 为解决使用深度学习检测生成式文本隐写中隐藏信息的挑战。
  • 探究用于隐写的语言模型是否可被重新用于提升隐写分析性能。
  • 开发高效、可泛化的预训练模型,即使在载体文本远多于伪装文本的情况下也能保持良好表现。
  • 通过在载体文本分布上进行预训练,加速模型收敛并提升检测准确率。

提出的方法

  • 在大规模载体文本上预训练基于RNN的语言模型,以捕捉词的条件概率分布,该分布反映了伪装文本与载体文本之间的统计差异。
  • 将预训练的语言模型微调为隐写分析分类器,用于检测生成文本中的隐藏信息。
  • 使用序列自编码器进行预训练,以学习鲁棒的句子级表征,从而超越仅预测下一个词的建模,更好地捕捉全局文本结构。
  • 通过微调将预训练语言模型或自编码器的知识迁移至下游RNN分类器,用于隐写分析。
  • 使用交叉熵损失端到端训练隐写分析模型,并通过在大规模未标注载体文本语料上进行预训练,以提升泛化能力。
  • 在多个数据集(MOVIE、TWITTER)和隐写方法(VLC、FLC、Bins)下,于不同嵌入速率(1、2、3 bpw)下评估性能。

实验结果

研究问题

  • RQ1能否利用生成式隐写中所用语言模型的统计特性来提升隐写分析性能?
  • RQ2在载体文本上预训练语言模型或自编码器,是否能相比随机初始化获得更高的检测准确率和更快的收敛速度?
  • RQ3随着预训练数据规模的增加,预训练模型的性能如何变化?
  • RQ4在高度不平衡的数据集(载体文本远多于伪装文本)的真实场景中,预训练模型是否仍能有效泛化?

主要发现

  • 所提出的LM-RNN和AE-RNN方法在检测准确率上达到最先进水平,优于现有方法如GNN、CNN、FCN以及随机初始化的RNN。
  • AE-RNN性能略优于LM-RNN,可能归因于其能够建模完整的句子表征,而不仅限于下一个词的预测。
  • 预训练显著加速了收敛过程,如训练曲线所示损失下降更快(图6)。
  • 随着预训练数据集增大,性能持续提升:MOVIE数据集上的平均准确率从0.9474提升至0.9535,当预训练样本从6.3k增至18k时。
  • 在数据平衡场景下取得最佳结果,但即使在高度不平衡数据中,方法依然有效,适用于真实世界部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。