Skip to main content
QUICK REVIEW

[论文解读] Neural Linguistic Steganography

Zachary M. Ziegler, Yuntian Deng|arXiv (Cornell University)|Sep 3, 2019
Authorship Attribution and Profiling参考文献 17被引用 4
一句话总结

本文提出了一种基于大语言模型的神经语言隐写术方法,利用算术编码将秘密信息嵌入自然语言载体文本中。该方法通过使载体文本分布与语言模型分布相匹配,实现了近乎最优的统计安全性,同时人工评估证实生成的句子即使在有上下文线索的情况下也与人类撰写的文本无法区分。

ABSTRACT

Whereas traditional cryptography encrypts a secret message into an unintelligible form, steganography conceals that communication is taking place by encoding a secret message into a cover signal. Language is a particularly pragmatic cover signal due to its benign occurrence and independence from any one medium. Traditionally, linguistic steganography systems encode secret messages in existing text via synonym substitution or word order rearrangements. Advances in neural language models enable previously impractical generation-based techniques. We propose a steganography technique based on arithmetic coding with large-scale neural language models. We find that our approach can generate realistic looking cover sentences as evaluated by humans, while at the same time preserving security by matching the cover message distribution with the language model distribution.

研究动机与目标

  • 开发一种隐写系统,将秘密信息隐藏在自然语言中,且与真实语言分布的统计偏差最小化。
  • 利用现代大语言模型生成流畅、上下文合适的载体文本,使其与人类撰写的文本无法区分。
  • 通过最小化生成载体分布与真实语言模型分布之间的KL散度,实现近乎最优的统计安全性。
  • 评估系统在算法隐写分析和人工检测下的有效性,特别是在上下文约束条件下的表现。

提出的方法

  • 该方法使用算术编码将秘密消息的比特映射为符合预训练语言模型概率分布的标记序列。
  • 一个确定性、可逆的函数 f 将秘密消息映射为载体文本,确保可逆性并使接收方能够一致地解码。
  • 语言模型 p(y) 作为先验分布,隐写函数 f 的设计目标是使生成的载体分布 q 尽可能接近 p(y),从而最小化 KL(q||p(y))。
  • 系统采用上下文感知的编码过程,载体文本基于给定上下文生成,从而提升连贯性和上下文合理性。
  • 对于本身为自然语言的消息,该方法首先使用空上下文的算术编码将消息压缩为均匀分布的比特,然后再嵌入载体文本。
  • 该方法基于最先进的语言模型实现,支持端到端生成与解码,并提供公开代码和在线演示。

实验结果

研究问题

  • RQ1结合算术编码与大语言模型能否生成在统计上与真实人类文本无法区分的载体文本?
  • RQ2在基于上下文的续写任务中,生成的载体文本在多大程度上能欺骗人类评估者?
  • RQ3在不同编码速率(每词比特数)下,系统的安全性(以KL散度衡量)如何变化?
  • RQ4该方法能否高效地将自然语言消息嵌入无关的、看似无害的载体文本中,同时保持流畅性和连贯性?
  • RQ5与启发式或基于规则的生成方法相比,使用大语言模型是否显著提升了隐写性能?

主要发现

  • 使用大语言模型的算术编码实现了 4e-8 nats 的KL散度,表明与真实语言模型分布的统计不可区分性接近完美。
  • 在每词1比特的速率下,人工评估显示生成的载体文本在统计上与人类撰写的文本无法区分,超过50%的参与者认为其是合理的文本延续。
  • 人工评估表明,霍夫曼编码与算术编码均能生成流畅的载体文本,但算术编码保持了更安全的分布,这一点通过更低的KL散度得到验证。
  • 该系统成功将自然语言消息嵌入无关但语义连贯的载体文本中,消息内容与载体内容显著不同,但保持了语言流畅性。
  • 该方法在低压缩率(如每词1比特)下表现最优,此时载体文本既安全又无法被人类察觉,尽管性能随语言模型质量的提升而进一步改善。
  • 该方法表明,现代语言模型可被直接集成到隐写系统中,以最大化安全性和生成质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。