Skip to main content
QUICK REVIEW

[논문 리뷰] Heard More Than Heard: An Audio Steganography Method Based on GAN

Dengpan Ye, Shunzhi Jiang|arXiv (Cornell University)|2019. 07. 11.
Advanced Steganography and Watermarking Techniques참고 문헌 14인용 수 18
한 줄 요약

이 논문은 인간이 수작업으로 설계한 임베딩 규칙에 의존하지 않고, 청각적으로 거의 구별되지 않는 왜곡을 최소화하면서도 비밀 음성 신호를 캐리어 음성에 자동으로 삽입할 수 있는 GAN 기반 음성 스테가노그래피 방법을 제안한다. 인코더, 디코더, 판별기의 세 가지 모듈을 함께 훈련시켜 적대적 프레임워크를 구축함으로써, 외부 스테가노그래피 분석 도구에 의해 탐지되지 않는 고음질의 스테가노그래피 음성을 구현하였으며, 기존 수작업 기반 방법에 비해 강건성과 보안성 면에서 뛰어난 성능을 보였다.

ABSTRACT

Audio steganography is a collection of techniques for concealing the existence of information by embedding it within a non-secret audio, which is referred to as carrier. Distinct from cryptography, the steganography put emphasis on the hiding of the secret existence. The existing audio steganography methods mainly depend on human handcraft, while we proposed an audio steganography algorithm which automatically generated from adversarial training. The method consists of three neural networks: encoder which embeds the secret message in the carrier, decoder which extracts the message, and discriminator which determine the carriers contain secret messages. All the networks are simultaneously trained to create embedding, extracting and discriminating process. The system is trained with different training settings on two datasets. Competed the majority of audio steganographic schemes, the proposed scheme could produce high fidelity steganographic audio which contains secret audio. Besides, the additional experiments verify the robustness and security of our algorithm.

연구 동기 및 목표

  • 수작업으로 설계된 임베딩 규칙에 의존하는 것을 줄이기 위한 자동화된 음성 스테가노그래피 방법 개발
  • 외부 스테가노그래피 분석 도구를 모방하는 판별기를 활용한 적대적 훈련을 통해 스테가노그래피 음성의 품질과 청각적 불가지각성을 향상시키기
  • 채널 노이즈에 대한 강건성을 향상시키고 독립적인 스테가노그래피 분석 도구에 대한 보안성을 강화하기
  • 인간이 설계한 특징 없이 GAN을 사용해 종단 간 스테가노그래피 임베딩 및 복원을 학습하는 것이 가능한지 검증하기

제안 방법

  • 모델은 세 가지 구성 요소로 이루어진 GAN 프레임워크를 사용한다: 비밀 음성을 캐리어 음성에 삽입하는 인코더, 스테가노그래피 음성에서 비밀을 복원하는 디코더, 스테가노그래피 콘텐츠를 탐지하는 판별기
  • 인코더와 디코더는 재구성 손실과 판별기로부터 유도된 적대적 손실을 포함하는 복합 손실 함수를 통해 종단 간으로 동시에 훈련된다
  • 판별기는 진짜 캐리어 음성과 스테가노그래피 음성을 구분하도록 훈련되어, 인코더가 더 현실적으로 탐지되지 않는 스테가노그래피 출력을 생성하도록 유도한다
  • 훈련 과정은 인코더가 판별기를 속이려는 적대적 최적화와 디코더가 스테가노그래피 음성에서 원본 비밀을 재구성하도록 학습하는 방식을 포함한다
  • 강건성 평가를 위해 두 가지 훈련 설정을 평가한다: NOR(일반 훈련)와 AN(노이즈 주입을 포함한 적대적 훈련)
  • 청각적 유사성과 신호 품질 평가에 스펙트로그램과 신호 지표(MSE, SNR)를 사용한다

실험 결과

연구 질문

  • RQ1수작업으로 설계된 임베딩 규칙 없이도 GAN 기반 프레임워크가 효과적인 음성 스테가노그래피를 자동으로 학습할 수 있는가?
  • RQ2비밀 메시지를 삽입하는 과정에서 음성 품질은 얼마나 잘 유지되는가?
  • RQ3노이즈가 있는 채널 조건에서도 모델이 높은 비밀 복원 정확도를 유지할 수 있는가?
  • RQ4SRM 및 CNN 기반 스테가노그래피 분석 도구와 같은 독립적인 분석 도구에 대해 모델의 효과성은 어떠한가?

주요 결과

  • 제안된 GAN 기반 스테가노그래피 방법은 캐리어 음성과 스테가노그래피 음성 간에 거의 동일한 스펙트로그램을 보이며, 청각적으로 거의 구별되지 않는 고음질의 스테가노그래피 음성을 구현하였다
  • AN 훈련 설정에서 TIMIT 데이터셋 기준 비밀 손실 MSE는 0.0002이며, 비밀 신호 대비 신호 대 노이즈 비율(SNR)은 1.9642로, 60 dB의 가우시안 노이즈 하에서도 뛰어난 복원 성능을 보였다
  • TIMIT 데이터셋에서 SRM 스테가노그래피 분석 도구에 대해 91.56%의 정확도, CNN 기반 스테가노그래피 분석 도구에 대해 92.58%의 정확도를 기록하여 탐지에 대한 강력한 저항성을 입증하였다
  • AN 훈련 전략은 노이즈에 대한 강건성을 향상시켜 NOR 설정 대비 비밀 손실을 감소시키고 더 높은 SNR를 유지하였다. 반면 NOR 설정은 노이즈 하에서 성능 저하를 보였다
  • 모든 스테가노그래피 분석 도구와 데이터셋에서 기준 모델인 HCM과 ECCS에 비해 더 낮은 탐지 정확도를 기록하여 스테가노그래피 저항성 면에서 뛰어난 성능을 보였다

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.