Skip to main content
QUICK REVIEW

[论文解读] Generating Steganographic Text with LSTMs

Tina Fang, Martin Jaggi|arXiv (Cornell University)|May 30, 2017
Authorship Attribution and Profiling参考文献 18被引用 12
一句话总结

本文提出了一种基于长短期记忆(LSTM)网络的新型神经隐写系统,用于生成高质量的隐写文本,将加密消息隐藏在自然语言之中。通过将秘密位块映射到学习词汇中的词元分箱,LSTM 能够生成语言上自然的文本,信息容量最高可达每词 2 位——显著超过先前的最先进方法。

ABSTRACT

Motivated by concerns for user privacy, we design a steganographic system ("stegosystem") that enables two users to exchange encrypted messages without an adversary detecting that such an exchange is taking place. We propose a new linguistic stegosystem based on a Long Short-Term Memory (LSTM) neural network. We demonstrate our approach on the Twitter and Enron email datasets and show that it yields high-quality steganographic text while significantly improving capacity (encrypted bits per word) relative to the state-of-the-art.

研究动机与目标

  • 为应对依赖未加密消息进行定向广告的通信平台中监控带来的隐私风险。
  • 克服现有载体修改隐写系统存在的容量低和语言输出不自然的局限。
  • 开发一种基于神经网络的隐写系统,生成高质量、类人语言的隐写文本,具备高信息承载能力。
  • 实现双方在不触发被动监听者对消息流量怀疑的前提下,进行安全、不可检测的通信。

提出的方法

  • 系统使用一个共享密钥,将词汇表划分为 2^{|B|} 个互不相交的分箱,每个分箱对应一个长度为 |B| 的唯一位块。
  • 训练一种修改后的词粒度 LSTM,逐个生成文本词元,且仅限于选择与当前位块对应的分箱中的词元。
  • 秘密数据经过压缩并分割为固定长度的位块,随后通过分箱映射的词元选择嵌入隐写文本。
  • 模型在大规模数据集(Twitter 和 Enron 邮件)上进行训练,以保持句子和段落之间的上下文连贯性。
  • 通过调整分箱数量并可选地添加常用词元,系统支持容量与质量之间的灵活权衡。
  • 不进行任何手动后处理;隐写文本由 LSTM 直接生成,区别于马特里约卡风格的人工增强系统。

实验结果

研究问题

  • RQ1基于 LSTM 的语言模型能否生成既语言自然又高度优化容量的隐写文本?
  • RQ2所提出的隐写系统的容量与现有载体修改方法及神经隐写方法相比如何?
  • RQ3尽管存在分箱约束,该模型在长序列中多大程度上保持了上下文一致性和语法正确性?
  • RQ4系统能否在不牺牲感知质量的前提下实现高容量,经由人工或自动评估验证?
  • RQ5该系统是否足够稳健,能够抵抗隐写分析工具或人工判断者的检测,特别是与现有隐写系统相比?

主要发现

  • 所提出的基于 LSTM 的隐写系统实现了每条推文 32 位的信息容量(相当于每词约 2 位),比最先进的 CoverTweet 系统(每条推文 2.8 位)高出 11 倍以上。
  • 生成的隐写文本保持了高水平的语言质量,示例显示其句法正确且自然程度与真实人类推文相当。
  • 即使在最多 4 个分箱的情况下,系统仍能保持句子和段落间的上下文一致性,表明对分箱约束具有鲁棒性。
  • 系统实现了容量与质量之间的灵活权衡:增加分箱数量可提升容量,而减少分箱并添加常用词元则可提高流畅度。
  • 与现有载体修改系统相比,该模型在容量方面表现更优,因为后者受限于可用变换选项的数量。
  • 初步结果表明,该系统可能对人工判断者具有抗检测能力,但正式评估计划在后续工作中进行。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。