[논문 리뷰] Adversarial Audio: A New Information Hiding Method and Backdoor for DNN-based Speech Recognition Models
이 논문은 비공개 DNN 기반 음성 인식(ASR) 모델 내에서 훈련된 적대적 편향을 사용하여 음성 신호에 숨겨진 정보를 삽입하는 새로운 음성 스테가노그래피 기법을 제안한다. 이 기법은 높은 인지성(Perceptual Quality, PESQ ≈ 3.598)과 강력한 보안성을 확보하며, 1초당 48자(48 cps)의 숨겨진 정보 전송 용량을 달성한다. 공개된 ASR 모델들은 숨겨진 내용을 추출하지 못한다. 또한 이와 동일한 기법을 사용해 DNN 기반 ASR 모델 내부의 내재된 백도어를 활성화할 수 있으며, 지능형 스피커와 같은 기기의 보안에 심각한 위협을 가한다.
Audio is an important medium in people's daily life, hidden information can be embedded into audio for covert communication. Current audio information hiding techniques can be roughly classed into time domain-based and transform domain-based techniques. Time domain-based techniques have large hiding capacity but low imperceptibility. Transform domain-based techniques have better imperceptibility, but the hiding capacity is poor. This paper proposes a new audio information hiding technique which shows high hiding capacity and good imperceptibility. The proposed audio information hiding method takes the original audio signal as input and obtains the audio signal embedded with hidden information (called stego audio) through the training of our private automatic speech recognition (ASR) model. Without knowing the internal parameters and structure of the private model, the hidden information can be extracted by the private model but cannot be extracted by public models. We use four other ASR models to extract the hidden information on the stego audios to evaluate the security of the private model. The experimental results show that the proposed audio information hiding technique has a high hiding capacity of 48 cps with good imperceptibility and high security. In addition, our proposed adversarial audio can be used to activate an intrinsic backdoor of DNN-based ASR models, which brings a serious threat to intelligent speakers.
연구 동기 및 목표
- 기존 음성 스테가노그래피 기법에서의 숨겨진 정보 용량과 인지성 간의 상충 관계를 해결하기 위해.
- 자원이 제한된 IoT 기기(예: 지능형 스피커)에 적합한 보안성 높고 오버헤드가 낮은 정보 은닉 기법을 개발하기 위해.
- 적대적 음성 신호를 사용해 DNN 기반 ASR 모델 내부의 내재된 백도어를 활성화할 수 있음을 보여주기 위해.
- 공개된 ASR 모델 및 스테가노그래피 분석 기법에 대한 제안 기법의 강건성과 보안성을 평가하기 위해.
- 기존 ASR 인프라를 활용해 엣지 기기에서 은밀한 통신을 위한 실용적이고 키 기반 없는 솔루션을 제공하기 위해.
제안 방법
- 비공개로 훈련된 DNN 기반 ASR 모델을 사용해, 청취자 인지 품질에 영향을 주지 않으면서도 음성 신호에 숨겨진 정보를 삽입하는 적대적 편향을 생성한다.
- 숨겨진 정보는 전체 문장으로 인코딩되며, 이는 훈련된 ASR 모델이 훼손된 음성 신호를 대상 텍스트로 인식하도록 하여 삽입된다.
- 스테고(Stego) 음성은 원본 음성에 훈련된 적대적 편향을 적용하여 생성되며, 음성 품질은 유지하면서도 데이터가 삽입된다.
- 숨겨진 정보의 추출은 비공개 ASR 모델을 통해서만 가능하며, 이는 삽입된 내용을 복호화하도록 설계되어 있다.
- 암호화 오버헤드를 피하기 위해 모델 고유의 행동에 의존하므로, 자원이 제한된 IoT 기기에서 사용하기에 적합하다.
- 보안성 평가를 위해 스테고 음성을 네 가지 공개 ASR 모델(Google, IBM 등)에 테스트한 결과, 숨겨진 정보를 추출하지 못했다.
실험 결과
연구 질문
- RQ1비공개 DNN 기반 ASR 모델 내의 적대적 편향을 사용해 고용량 및 고인간성의 음성 신호에 숨겨진 정보를 삽입할 수 있는가?
- RQ2제안된 기법은 숨겨진 정보 용량, 청취 품질, 공개 ASR 모델에 대한 저항성 측면에서 어떻게 성능을 발휘하는가?
- RQ3동일한 스테고 음성은 DNN 기반 ASR 모델 내부의 내재된 백도어를 활성화하는 데 사용될 수 있는가?
- RQ4기존의 음성 스테가노그래피 분석 기법에 대해 이 기법은 얼마나 효과적인가?
- RQ5이 기법은 자원이 제한된 IoT 기기(예: 지능형 스피커)에 실용적으로 구현 가능한가?
주요 결과
- 제안된 기법은 기존의 변환 도메인 기반 기법보다 훨씬 높은 48.0자/초의 숨겨진 정보 전송 용량을 달성한다.
- 3.598의 평균 PESQ 점수는 스테고 음성이 매우 인지적으로 불가능하며, 청취 품질에 거의 영향을 주지 않음을 시사한다.
- Google 및 IBM을 포함한 네 가지 공개 ASR 모델이 스테고 음성에서 숨겨진 정보를 추출하지 못했으며, 이는 강력한 보안성을 입증한다.
- 스테고 음성은 DNN 기반 ASR 모델 내부의 내재된 백도어를 성공적으로 활성화하여 지능형 기기의 무단 제어를 가능하게 했다.
- 키 저장 또는 복호화 과정이 필요 없어 경량이며, 자원이 제한된 IoT 기기에서의 배포에 적합하다.
- 현재의 스테가노그래피 분석 기법(예: QMDCT 계수에 기반한 CNN 기반 분석)은 원본 음성의 약 80%를 스테고 음성으로 잘못 분류하며, 이 기법을 탐지하는 데 있어 신뢰성이 낮음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.