Skip to main content
QUICK REVIEW

[논문 리뷰] Exploiting Language Model for Efficient Linguistic Steganalysis

Biao Yi, Hanzhou Wu|arXiv (Cornell University)|2021. 07. 26.
Advanced Steganography and Watermarking Techniques인용 수 4
한 줄 요약

이 논문은 언어 모델 기반 RNN(LM-RNN)과 오토에인코더 기반 RNN(AE-RNN)이라는 두 가지 사전 훈련 방법을 제안하여, 스테고 텍스트와 캐리어 텍스트 간의 단어 조건부 확률 분포의 통계적 차이를 활용함으로써 언어학적 스테가노그래피 분석 성능을 향상시킨다. 이 방법들은 무작위로 초기화된 RNN보다 탐지 정확도와 수렴 속도가 크게 향상되어, 특히 스테고 텍스트보다 캐리어 텍스트가 훨씬 많은 불균형 데이터 시나리오에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Recent advances in linguistic steganalysis have successively applied CNN, RNN, GNN and other efficient deep models for detecting secret information in generative texts. These methods tend to seek stronger feature extractors to achieve higher steganalysis effects. However, we have found through experiments that there actually exists significant difference between automatically generated stego texts and carrier texts in terms of the conditional probability distribution of individual words. Such kind of difference can be naturally captured by the language model used for generating stego texts. Through further experiments, we conclude that this ability can be transplanted to a text classifier by pre-training and fine-tuning to improve the detection performance. Motivated by this insight, we propose two methods for efficient linguistic steganalysis. One is to pre-train a language model based on RNN, and the other is to pre-train a sequence autoencoder. The results indicate that the two methods have different degrees of performance gain compared to the randomly initialized RNN, and the convergence speed is significantly accelerated. Moreover, our methods achieved the best performance compared to related works, while providing a solution for real-world scenario where there are more cover texts than stego texts.

연구 동기 및 목표

  • 생성 텍스트 스테가노그래피에서 비밀 정보를 탐지하기 위한 딥러닝 기반 도전 과제를 해결하기 위해.
  • 스테가노그래피에 사용된 언어 모델이 스테가노그래피 분석 성능 향상에 재사용될 수 있는지 탐구하기 위해.
  • 캐리어 텍스트가 스테고 텍스트보다 훨씬 많을 경우에도 잘 일반화되는 효율적인 사전 훈련 모델을 개발하기 위해.
  • 캐리어 텍스트 분포에 대해 사전 훈련을 통해 모델 수렴 속도를 가속화하고 탐지 정확도를 향상시키기 위해.

제안 방법

  • 대규모 캐리어 텍스트에 기반한 RNN 기반 언어 모델을 사전 훈련하여, 스테고 텍스트와 캐리어 텍스트 간의 통계적 차이를 반영하는 단어의 조건부 확률 분포를 캡처한다.
  • 사전 훈련된 언어 모델을 미세조정하여 스테가노그래피 분석 분류기로 활용하여 생성된 텍스트 내의 숨겨진 메시지를 탐지한다.
  • 문장 수준의 표현을 강력하게 학습하기 위해 시퀀스 오토에인코더를 사용하여 사전 훈련함으로써, 다음 단어 예측을 넘어서 전반적인 텍스트 구조 모델링을 향상시킨다.
  • 사전 훈련된 언어 모델이나 오토에인코더에서의 지식을 미세조정을 통해 하류 RNN 분류기로 전이하여 스테가노그래피 분석을 수행한다.
  • 교차 엔트로피 손실을 사용하여 스테가노그래피 모델을 엔드 투 엔드로 훈련하며, 일반화 성능 향상을 위해 대규모 비라벨 캐리어 텍스트 코퍼스에 대해 사전 훈련을 수행한다.
  • 다양한 임베딩 비율(1, 2, 3 bpw)에서 MOVIE, TWITTER 등의 다수의 데이터셋과 스테가노그래픽 방법(VLC, FLC, Bins)에 대해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1생성 스테가노그래피에 사용된 언어 모델의 통계적 특성을 활용하여 스테가노그래피 분석 성능 향상을 이룰 수 있는가?
  • RQ2캐리어 텍스트에 대해 언어 모델이나 오토에인코더를 사전 훈련하면, 무작위 초기화보다 더 높은 탐지 정확도와 더 빠른 수렴 속도를 달성할 수 있는가?
  • RQ3사전 훈련 데이터 크기가 증가함에 따라 사전 훈련 모델의 성능는 어떻게 변화하는가?
  • RQ4매우 불균형한 데이터셋(스테고 텍스트보다 캐리어 텍스트가 훨씬 많음)에서도 사전 훈련 모델이 효과적으로 일반화될 수 있는가?

주요 결과

  • 제안된 LM-RNN 및 AE-RNN 방법은 GNN, CNN, FCN 및 무작위로 초기화된 RNN보다 최신 기술 수준의 탐지 정확도를 달성한다.
  • AE-RNN는 LM-RNN보다 略적으로 더 높은 성능를 보이며, 이는 다음 단어 예측을 넘어서 전체 문장 표현을 모델링할 수 있기 때문일 것이다.
  • 사전 훈련은 수렴 속도를 크게 가속화하며, 이는 훈련 곡선에서 손실 감소 속도가 더 빠른 것으로 확인되었다 (그림 6).
  • 사전 훈련 데이터셋이 커질수록 성능 향상이 나타났다: MOVIE 데이터셋에서 사전 훈련 데이터가 6.3k에서 18k로 증가함에 따라 평균 정확도가 0.9474에서 0.9535로 상승했다.
  • 균형 잡힌 데이터 시나리오에서 최고의 성능를 기록했지만, 매우 불균형한 데이터에서도 여전히 효과적이므로 실세계 적용에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.