[논문 리뷰] ASSERT: Anti-Spoofing with Squeeze-Excitation and Residual neTworks
ASSERT는 재생, TTS, 음성 변환 공격을 탐지하기 위해 스queeze-excitation 및 잔차 연결 네트워크를 활용한 DNN 기반의 위조 방지 시스템을 제안한다. 최적화된 특징 공학, 모델 아키텍처 및 앙상블 융합을 통해 ASVspoof 2019 PA 서브챌린지에서 t-DCF와 EER 모두 93% 이상의 상대적 향상을 달성하였고, LA 서브챌린지에서는 17%의 향상을 기록하여 각각 3위와 14위를 기록하였다.
We present JHU's system submission to the ASVspoof 2019 Challenge: Anti-Spoofing with Squeeze-Excitation and Residual neTworks (ASSERT). Anti-spoofing has gathered more and more attention since the inauguration of the ASVspoof Challenges, and ASVspoof 2019 dedicates to address attacks from all three major types: text-to-speech, voice conversion, and replay. Built upon previous research work on Deep Neural Network (DNN), ASSERT is a pipeline for DNN-based approach to anti-spoofing. ASSERT has four components: feature engineering, DNN models, network optimization and system combination, where the DNN models are variants of squeeze-excitation and residual networks. We conducted an ablation study of the effectiveness of each component on the ASVspoof 2019 corpus, and experimental results showed that ASSERT obtained more than 93% and 17% relative improvements over the baseline systems in the two sub-challenges in ASVspooof 2019, ranking ASSERT one of the top performing systems. Code and pretrained models will be made publicly available.
연구 동기 및 목표
- 재생, TTS, 음성 변환을 포함한 다양한 위조 공격을 탐지할 수 있는 강력한 DNN 기반 위조 방지 파ip라인 개발
- 물리적 및 논리적 접근 시나리오에서 스queeze-excitation 및 잔차 연결 네트워크 변형의 위조 탐지 효능 탐구
- ASVspoof 2019 벤치마크에서 일반화 및 성능 향상을 위한 특징 공학, 네트워크 아키텍처 및 시스템 융합 전략의 최적화
- GMM 및 i-vector 모델과 같은 기준 시스템 대비 PA 및 LA 서브챌린지에서 t-DCF 및 EER 측면에서 성능 향상 달성
- 향후 위조 방지 연구를 위한 공개된 코드베이스 및 사전 학습 모델 제공
제안 방법
- CMVN 또는 음성 활성도 검출 없이, 일정 Q 청각 계수(CQCC) 및 로그 스펙트럼 강도(로그스펙)를 저수준 음성 특징으로 사용
- 발화문을 400 프레임의 배수로 확장하고 200프레임 겹침을 이용해 세그먼트화하여 DNN 입력용 통합 특징 맵 구축
- 스queeze-excitation 모듈을 활용한 특징 재조정을 위한 SENet34, SENet50, 평균-표준편차 잔차 연결 네트워크, 확장 잔차 연결 네트워크, 주의 필터링 네트워크 기반 DNN 모델 설계
- 개발 세트 정확도 기반 모델 선택을 위해 이진 교차 엔트로피 손실을 사용하여 모델 훈련, EER 기반 선택 아님
- 조기 융합 및 후기 융합 전략을 활용해 다섯 개의 단일 시스템(Senet34, 평균-표준편차 잔차 연결 네트워크, 확장 잔차 연결 네트워크 포함)을 융합하여 내성 향상
- DNN 구현은 PyTorch를, 특징 추출은 Kaldi를 사용하였으며, 데이터 증강 또는 외부 데이터 사용 없음
실험 결과
연구 질문
- RQ1ASVspoof 2019 챌린지에서 재생, TTS, VC를 포함한 다수의 공격 유형에 대해 스queeze-excitation 및 잔차 연결 네트워크 변형의 위조 탐지 효능은 어떠한가?
- RQ2다른 특징 표현 방식(CQCC 대비 로그스펙)과 특징 공학 전략(겹침이 있는 통합 맵 대비 전체 발화문)이 위조 방지 성능에 미치는 영향은 무엇인가?
- RQ3학습 목표(이진 대 다중 작업)와 모델 선택 기준(EER 대 정확도)이 최종 시스템 성능에 미치는 영향은 어떠한가?
- RQ4다양한 DNN 모델의 앙상블 융합이 PA 및 LA 서브챌린지에서 미리 보지 않은 데이터에 대한 일반화 및 내성 향상에 얼마나 기여하는가?
- RQ5제안된 DNN 기반 시스템은 GMM 및 i-vector 시스템과 비교해 t-DCF 및 EER 측면에서 정량적으로 어떻게 성능을 냈는가?
주요 결과
- PA 서브챌린지 평가 세트에서 ASSERT는 CQCC-GMM 기준으로 t-DCF에 93%의 상대적 향상과 EER에 94%의 상대적 향상을 달성하였다.
- LA 서브챌린지에서는 주요 시스템이 LFCC-GMM 기준으로 t-DCF에 27%의 상대적 향상과 EER에 17%의 상대적 향상을 기록하였다.
- 가장 우수한 단일 시스템인 SENet34(로그스펙 및 200프레임 겹침이 있는 통합 특징 맵 사용)는 PA 서브챌린지에서 t-DCF와 EER 모두 기준 시스템 대비 92% 및 94%의 상대적 향상을 기록하였다.
- 시스템은 PA 서브챌린지에서 3위, LA 서브챌린지에서 14위를 기록하여 강력한 일반화 및 내성 성능을 입증하였다.
- 통합 특징 맵과 겹침을 활용한 특징 공학 전략이 전체 발화문 또는 겹침이 없는 세그먼트 접근 방식보다 성능 향상에 크게 기여하였다.
- 제거 분석 결과, 로그스펙이 CQCC보다 우수했고, EER 기반 선택 대비 정확도 기반 선택이 더 나은 성능을 냈음을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.