Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic-Preserving Linguistic Steganography by Pivot Translation and Semantic-Aware Bins Coding

Tianyu Yang, Hanzhou Wu|arXiv (Cornell University)|2022. 03. 08.
Advanced Steganography and Watermarking Techniques인용 수 4
한 줄 요약

이 논문은 언어 간 피벗 번역과 의미 인식형 바이너리 인코딩을 활용하여 높은 페이로드를 유지하면서도 의미 일관성을 보존하는 새로운 언어적 스테가노그래피 기법을 제안한다. 원본 텍스트를 피벗 언어(예: 영어)로 번역하고 다시 원래 언어로 번역함으로써 의미는 그대로 유지하면서 표현 방식을 변경함으로써, 기존의 수정 기반 및 생성 기반 접근 방식에 비해 더 뛰어난 의미 품질과 스테가노그래피 저항성을 달성한다.

ABSTRACT

Linguistic steganography (LS) aims to embed secret information into a highly encoded text for covert communication. It can be roughly divided to two main categories, i.e., modification based LS (MLS) and generation based LS (GLS). Unlike MLS that hides secret data by slightly modifying a given text without impairing the meaning of the text, GLS uses a trained language model to directly generate a text carrying secret data. A common disadvantage for MLS methods is that the embedding payload is very low, whose return is well preserving the semantic quality of the text. In contrast, GLS allows the data hider to embed a high payload, which has to pay the high price of uncontrollable semantics. In this paper, we propose a novel LS method to modify a given text by pivoting it between two different languages and embed secret data by applying a GLS-like information encoding strategy. Our purpose is to alter the expression of the given text, enabling a high payload to be embedded while keeping the semantic information unchanged. Experimental results have shown that the proposed work not only achieves a high embedding payload, but also shows superior performance in maintaining the semantic consistency and resisting linguistic steganalysis.

연구 동기 및 목표

  • 언어적 스테가노그래피에서 높은 임베딩 페이로드와 의미 일관성 사이의 상충 관계를 해결하기 위해.
  • 수정 기반 언어적 스테가노그래피(MLS)의 낮은 페이로드와 생성 기반 언어적 스테가노그래피(GLS)의 의미 일관성 부족 문제를 해결하기 위해.
  • 자연스러움과 의미 정확성을 유지하면서도 높은 용량의 데이터 숨기기를 가능하게 하기 위해.
  • 언어적 스테가노그래피 분석에 대한 감지 가능성을 줄임으로써 스테가노그래픽 보안을 향상시키기 위해.

제안 방법

  • 이 방법은 원본 텍스트를 피벗 언어(예: 영어)로 번역하고 다시 원래 언어로 번역하는 Seq2Seq2Seq 모델을 사용하여 의미는 유지하면서 표현 방식을 변경한다.
  • 비밀 데이터는 의미 유사도와 확률을 기반으로 단어 선택에 따라 비트를 매핑하는 의미 인식형 바이너리 인코딩(SaBins) 전략을 통해 백번역 과정 중에 임베딩된다.
  • SaBins 기법은 의미적으로 유사한 단어 후보군 중에서 동의어가 풍부한 선택지를 활용하여 비트를 인코딩함으로써 의미의 편차를 최소화한다.
  • 미리 정의된 서브워드 수준의 토큰화 전략을 도입하여 알 수 없는 토큰을 줄이고, 품질과 보안성을 향상시킨다.
  • 모델 미세조정 및 SaBins 인코딩을 사전에 수행하는 오프라인 방식으로 운영되며, 이로 인해 실시간 스테고 텍스트 생성이 효율적으로 가능하다.
  • 의미 품질 비교를 위한 기준선으로 비밀 데이터 없이 생성된 제로비트 텍스트를 사용하여 평가한다.

실험 결과

연구 질문

  • RQ1언어 간 피벗 번역이 의미를 유지하면서도 고용량 데이터 임베딩을 가능하게 할 수 있는가?
  • RQ2의미 인식형 바이너리 인코딩 기법은 스테고 텍스트의 품질과 탐지 저항성에 어떻게 기여하는가?
  • RQ3서브워드 수준 처리 방식은 단어 수준 인코딩 대비 강건성과 탐지 저항성 향상에 기여하는가?
  • RQ4제안된 방법은 MLS 및 GLS 대비 페이로드, 의미 일관성, 스테가노그래피 분석 저항성 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 방법은 수정 기반 LS 방법에 비해 유의미하게 높은 임베딩 페이로드를 달성하면서도 뛰어난 의미 일관성을 유지한다.
  • 제안된 방법으로 생성된 스테고 텍스트는 GLS 기준선에 비해 자연어 제로비트 텍스트와 더 유사하여 더 높은 의미 품질을 나타낸다.
  • 언어적 스테가노그래피 분석에 대해 더 강력한 저항성을 보이며, 최신 GLS 방법(예: Bins 및 RNN-Stega)에 비해 탐지 정확도가 낮다.
  • 서브워드 수준의 구현은 알 수 없는 토큰을 줄이고 강건성을 향상시켜 품질과 탐지 저항성 측면에서 단어 수준 접근 방식을 능가한다.
  • 기존 GLS 기준선에서 공통 토큰을 사용하면 품질이 약간 향상되지만 여전히 제안된 방법에 비해 탐지 가능성은 높다.
  • 다양한 메트릭을 통한 광범위한 실험 결과, 제안된 방법은 페이로드, 의미 충실도, 스테가노그래피 분석 저항성 측면에서 모두 MLS 및 GLS 기준선을 능가함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.