Skip to main content
QUICK REVIEW

[논문 리뷰] ASSERT: Anti-Spoofing with Squeeze-Excitation and Residual neTworks

Cheng-I Lai, Nanxin Chen|arXiv (Cornell University)|2019. 04. 01.
Speech Recognition and Synthesis참고 문헌 33인용 수 18
한 줄 요약

ASSERT는 재생, TTS, 음성 변환 공격을 탐지하기 위해 스queeze-excitation 및 잔차 연결 네트워크를 활용한 DNN 기반의 위조 방지 시스템을 제안한다. 최적화된 특징 공학, 모델 아키텍처 및 앙상블 융합을 통해 ASVspoof 2019 PA 서브챌린지에서 t-DCF와 EER 모두 93% 이상의 상대적 향상을 달성하였고, LA 서브챌린지에서는 17%의 향상을 기록하여 각각 3위와 14위를 기록하였다.

ABSTRACT

We present JHU's system submission to the ASVspoof 2019 Challenge: Anti-Spoofing with Squeeze-Excitation and Residual neTworks (ASSERT). Anti-spoofing has gathered more and more attention since the inauguration of the ASVspoof Challenges, and ASVspoof 2019 dedicates to address attacks from all three major types: text-to-speech, voice conversion, and replay. Built upon previous research work on Deep Neural Network (DNN), ASSERT is a pipeline for DNN-based approach to anti-spoofing. ASSERT has four components: feature engineering, DNN models, network optimization and system combination, where the DNN models are variants of squeeze-excitation and residual networks. We conducted an ablation study of the effectiveness of each component on the ASVspoof 2019 corpus, and experimental results showed that ASSERT obtained more than 93% and 17% relative improvements over the baseline systems in the two sub-challenges in ASVspooof 2019, ranking ASSERT one of the top performing systems. Code and pretrained models will be made publicly available.

연구 동기 및 목표

  • 재생, TTS, 음성 변환을 포함한 다양한 위조 공격을 탐지할 수 있는 강력한 DNN 기반 위조 방지 파ip라인 개발
  • 물리적 및 논리적 접근 시나리오에서 스queeze-excitation 및 잔차 연결 네트워크 변형의 위조 탐지 효능 탐구
  • ASVspoof 2019 벤치마크에서 일반화 및 성능 향상을 위한 특징 공학, 네트워크 아키텍처 및 시스템 융합 전략의 최적화
  • GMM 및 i-vector 모델과 같은 기준 시스템 대비 PA 및 LA 서브챌린지에서 t-DCF 및 EER 측면에서 성능 향상 달성
  • 향후 위조 방지 연구를 위한 공개된 코드베이스 및 사전 학습 모델 제공

제안 방법

  • CMVN 또는 음성 활성도 검출 없이, 일정 Q 청각 계수(CQCC) 및 로그 스펙트럼 강도(로그스펙)를 저수준 음성 특징으로 사용
  • 발화문을 400 프레임의 배수로 확장하고 200프레임 겹침을 이용해 세그먼트화하여 DNN 입력용 통합 특징 맵 구축
  • 스queeze-excitation 모듈을 활용한 특징 재조정을 위한 SENet34, SENet50, 평균-표준편차 잔차 연결 네트워크, 확장 잔차 연결 네트워크, 주의 필터링 네트워크 기반 DNN 모델 설계
  • 개발 세트 정확도 기반 모델 선택을 위해 이진 교차 엔트로피 손실을 사용하여 모델 훈련, EER 기반 선택 아님
  • 조기 융합 및 후기 융합 전략을 활용해 다섯 개의 단일 시스템(Senet34, 평균-표준편차 잔차 연결 네트워크, 확장 잔차 연결 네트워크 포함)을 융합하여 내성 향상
  • DNN 구현은 PyTorch를, 특징 추출은 Kaldi를 사용하였으며, 데이터 증강 또는 외부 데이터 사용 없음

실험 결과

연구 질문

  • RQ1ASVspoof 2019 챌린지에서 재생, TTS, VC를 포함한 다수의 공격 유형에 대해 스queeze-excitation 및 잔차 연결 네트워크 변형의 위조 탐지 효능은 어떠한가?
  • RQ2다른 특징 표현 방식(CQCC 대비 로그스펙)과 특징 공학 전략(겹침이 있는 통합 맵 대비 전체 발화문)이 위조 방지 성능에 미치는 영향은 무엇인가?
  • RQ3학습 목표(이진 대 다중 작업)와 모델 선택 기준(EER 대 정확도)이 최종 시스템 성능에 미치는 영향은 어떠한가?
  • RQ4다양한 DNN 모델의 앙상블 융합이 PA 및 LA 서브챌린지에서 미리 보지 않은 데이터에 대한 일반화 및 내성 향상에 얼마나 기여하는가?
  • RQ5제안된 DNN 기반 시스템은 GMM 및 i-vector 시스템과 비교해 t-DCF 및 EER 측면에서 정량적으로 어떻게 성능을 냈는가?

주요 결과

  • PA 서브챌린지 평가 세트에서 ASSERT는 CQCC-GMM 기준으로 t-DCF에 93%의 상대적 향상과 EER에 94%의 상대적 향상을 달성하였다.
  • LA 서브챌린지에서는 주요 시스템이 LFCC-GMM 기준으로 t-DCF에 27%의 상대적 향상과 EER에 17%의 상대적 향상을 기록하였다.
  • 가장 우수한 단일 시스템인 SENet34(로그스펙 및 200프레임 겹침이 있는 통합 특징 맵 사용)는 PA 서브챌린지에서 t-DCF와 EER 모두 기준 시스템 대비 92% 및 94%의 상대적 향상을 기록하였다.
  • 시스템은 PA 서브챌린지에서 3위, LA 서브챌린지에서 14위를 기록하여 강력한 일반화 및 내성 성능을 입증하였다.
  • 통합 특징 맵과 겹침을 활용한 특징 공학 전략이 전체 발화문 또는 겹침이 없는 세그먼트 접근 방식보다 성능 향상에 크게 기여하였다.
  • 제거 분석 결과, 로그스펙이 CQCC보다 우수했고, EER 기반 선택 대비 정확도 기반 선택이 더 나은 성능을 냈음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.