[论文解读] TS-CNN: Text Steganalysis from Semantic Space Based on Convolutional Neural Network
本文提出TS-CNN,一种文本隐写分析方法,通过卷积神经网络检测隐写编码前后在高层语义空间中的细微分布偏移,以识别隐蔽信息。该模型在新收集的CT-Steg数据集上实现了接近100%的精确率与召回率,并能以超过70%的准确率估计隐藏信息容量。
Steganalysis has been an important research topic in cybersecurity that helps to identify covert attacks in public network. With the rapid development of natural language processing technology in the past two years, coverless steganography has been greatly developed. Previous text steganalysis methods have shown unsatisfactory results on this new steganography technique and remain an unsolved challenge. Different from all previous text steganalysis methods, in this paper, we propose a text steganalysis method(TS-CNN) based on semantic analysis, which uses convolutional neural network(CNN) to extract high-level semantic features of texts, and finds the subtle distribution differences in the semantic space before and after embedding the secret information. To train and test the proposed model, we collected and released a large text steganalysis(CT-Steg) dataset, which contains a total number of 216,000 texts with various lengths and various embedding rates. Experimental results show that the proposed model can achieve nearly 100\% precision and recall, outperforms all the previous methods. Furthermore, the proposed model can even estimate the capacity of the hidden information inside. These results strongly support that using the subtle changes in the semantic space before and after embedding the secret information to conduct text steganalysis is feasible and effective.
研究动机与目标
- 应对自然语言中无载体隐写日益增长的挑战,此类隐写方式可规避传统统计隐写分析方法。
- 开发一种基于深度学习的方法,通过识别文本中语义分布的细微变化来检测隐写内容。
- 构建一个大规模、公开可用的数据集(CT-Steg),包含216,000篇不同长度和嵌入率的文本,以支持稳健的训练与评估。
- 不仅实现对隐写文本的检测,还能估计其中嵌入的隐藏信息容量。
提出的方法
- 利用卷积神经网络(CNN)自动从输入文本中提取高层语义特征,无需人工特征工程。
- 将提取的语义特征映射到高维语义空间,以进行分布分析。
- 通过识别载体文本与隐写文本在语义空间分布中的细微统计差异来检测隐写。
- 应用t-SNE可视化技术,展示语义空间中按嵌入率聚类的文本,证实可检测到的分布偏移。
- 在包含嵌入率从0%到25%的CT-Steg数据集上进行模型训练与评估。
- 实施多尺度特征提取策略(TS-CNN (Multi))和全局语义建模变体(TS-CNN (Single)),以捕捉局部与全局的语义变化。
实验结果
研究问题
- RQ1深度语义表征学习能否在不依赖手工设计语言特征的情况下,有效检测文本中的隐写内容?
- RQ2在自然语言文本中,随着隐藏信息嵌入水平的变化,语义空间分布如何变化?
- RQ3在无载体隐写背景下,深度学习模型在高精确率与高召回率下检测隐写文本的能力如何?
- RQ4模型能否基于语义空间分布模式估计隐藏信息的嵌入率?
- RQ5所提出方法在不同文本长度和语义结构下是否具有鲁棒性?
主要发现
- TS-CNN在CT-Steg数据集上实现了接近100%的精确率与召回率,显著优于所有先前的文本隐写分析方法。
- 该模型成功检测到隐写编码引起的高维语义空间中细微的语义分布偏移,即使在低嵌入率下亦可识别。
- t-SNE可视化结果证实,相同嵌入率的隐写文本在语义空间中聚类在一起,且随着嵌入率增加,与载体文本的分离更加明显。
- 该模型能以超过70%的准确率估计隐藏信息容量,这是以往任何工作均未具备的能力。
- TS-CNN (Multi)专注于句子级语义特征,而TS-CNN (Single)强调句子间的连贯性,两者共同提升了检测的鲁棒性。
- 结果验证了语义空间分布差异是现代无载体隐写中可靠且有效的隐写分析信号。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。