Skip to main content
QUICK REVIEW

[论文解读] Provably Secure Generative Linguistic Steganography

Siyu Zhang, Zhongliang Yang|arXiv (Cornell University)|Jun 3, 2021
Advanced Steganography and Watermarking Techniques参考文献 30被引用 7
一句话总结

本文提出ADG,一种可证明安全的生成式语言隐写方法,通过基于预训练语言模型中词元概率的自适应动态分组,将秘密数据嵌入文本。该方法确保了与自然文本的统计不可区分性,实现了近乎完美的不可察觉性与高嵌入容量,具备数学上的安全证明,并在三个语料库中展现出强劲的实证结果。

ABSTRACT

Generative linguistic steganography mainly utilized language models and applied steganographic sampling (stegosampling) to generate high-security steganographic text (stegotext). However, previous methods generally lead to statistical differences between the conditional probability distributions of stegotext and natural text, which brings about security risks. In this paper, to further ensure security, we present a novel provably secure generative linguistic steganographic method ADG, which recursively embeds secret information by Adaptive Dynamic Grouping of tokens according to their probability given by an off-the-shelf language model. We not only prove the security of ADG mathematically, but also conduct extensive experiments on three public corpora to further verify its imperceptibility. The experimental results reveal that the proposed method is able to generate stegotext with nearly perfect security.

研究动机与目标

  • 解决现有生成式语言隐写方法在语言模型概率分布中引入统计失真的安全漏洞。
  • 开发一种确保隐写文本与自然文本在统计上不可区分的方法,从而抵抗统计隐写分析。
  • 在保持流畅性与不可察觉性的前提下实现高嵌入容量。
  • 从信息论标准出发,对所提方法进行数学上的安全性证明。
  • 在多个公开文本语料库上,通过实证验证该方法在不可察觉性、嵌入容量和抗隐写分析能力方面的性能。

提出的方法

  • ADG在每一步生成过程中,基于来自现成语言模型的条件概率,对词元进行自适应动态分组。
  • 通过从分组后的词元集合中选择,实现秘密信息的嵌入,同时保持语言模型整体概率分布不变。
  • 该方法根据词元概率动态调整分组策略,以最小化与自然文本的统计偏差。
  • 嵌入过程通过信息论分析形式化证明安全,表明在语言模型下,隐写文本分布与自然文本不可区分。
  • 提取过程为确定性且无损,依赖于分组策略与语言模型的共享知识。
  • 该方法利用现有的预训练语言模型,无需微调,从而实现兼容性与高效性。

实验结果

研究问题

  • RQ1能否从数学上证明一种生成式语言隐写方法对统计隐写分析是安全的?
  • RQ2基于语言模型概率的词元自适应动态分组是否能减少隐写文本中的统计失真?
  • RQ3能否在不损害流畅性或不可察觉性的前提下实现高嵌入容量?
  • RQ4与现有基线方法相比,该方法在KLD、检测准确率和有效嵌入率方面的表现如何?
  • RQ5在多种语料库中,隐写文本是否在统计上与自然文本不可区分?

主要发现

  • ADG的KLD1值非常接近0,表明其相对于语言模型自然分布的失真极小。
  • KLD2结果表明,隐写文本在统计上与自然文本一致,证实了其具备强大的信息论安全性。
  • 所有语料库中,隐写分析模型的检测准确率接近0.5,表明具有高度的不可察觉性。
  • ADG的有效嵌入率(EER)显著高于所有基线方法,证明其在保持安全性的同时具备强大的容量。
  • 表5中的定性示例表明,生成的隐写文本流畅、语法正确且语义连贯。
  • ADG在嵌入容量与不可察觉性方面均优于所有基线方法,在EER与KLD指标上展现出全面的性能优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。