[논문 리뷰] RW-Resnet: A Novel Speech Anti-Spoofing Model Using Raw Waveform
이 논문은 원시 파형을 직접 입력으로 사용하는 새로운 엔드 투 엔드 음성 가짜 위조 방지 모델인 RW-ResNet을 제안한다. 이 모델은 새로운 Conv1D Resblock을 활용하여 학습 가능한 시간-주파수 표현 방식인 ResWavegram을 추출한다. 모델은 ASVspoof2019 LA 코퍼스에서 EER 2.98%와 t-DCF 0.0817을 기록하며 최신 기술 수준(SOTA) 성능을 달성한다. 이는 음성 정보를 효과적으로 유지하고 잔차 연결을 통해 특징 학습을 향상시킴으로써 달성된다.
In recent years, synthetic speech generated by advanced text-to-speech (TTS) and voice conversion (VC) systems has caused great harms to automatic speaker verification (ASV) systems, urging us to design a synthetic speech detection system to protect ASV systems. In this paper, we propose a new speech anti-spoofing model named ResWavegram-Resnet (RW-Resnet). The model contains two parts, Conv1D Resblocks and backbone Resnet34. The Conv1D Resblock is based on the Conv1D block with a residual connection. For the first part, we use the raw waveform as input and feed it to the stacked Conv1D Resblocks to get the ResWavegram. Compared with traditional methods, ResWavegram keeps all the information from the audio signal and has a stronger ability in extracting features. For the second part, the extracted features are fed to the backbone Resnet34 for the spoofed or bonafide decision. The ASVspoof2019 logical access (LA) corpus is used to evaluate our proposed RW-Resnet. Experimental results show that the RW-Resnet achieves better performance than other state-of-the-art anti-spoofing models, which illustrates its effectiveness in detecting synthetic speech attacks.
연구 동기 및 목표
- 자동 화자 확인(ASV) 시스템에 대한 합성 음성 공격의 증가하는 위협을 해결하기 위해.
- 위상 정보와 기타 중요한 음성 정보를 손실하는 수작업 특징(LFCC 및 CQCC 등)의 한계를 극복하기 위해.
- 중간 단계의 특징 추출 없이 원시 파형을 직접 처리하는 엔드 투 엔드 딥 러닝 모델을 개발하기 위해.
- 원시 음성에서 유도된 신경망 기반의 학습 가능한 시간-주파수 표현을 도입하여 가짜 대 진짜 음성 탐지 성능을 향상시키기 위해.
- ASVspoof2019 로지컬 액세스 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 모델은 [-1, 1]로 정규화된 원시 파형을 입력으로 사용하며, 이를 통해 스택된 Conv1D Resblock을 거쳐 학습 가능한 시간-주파수 표현인 ResWavegram을 생성한다.
- 각 Conv1D Resblock은 확장률이 각각 1과 2인 두 개의 1D dilated 컨볼루션, ReLU 활성화 함수, 배치 정규화, 그리고 훈련 안정화와 특징 학습 향상을 위한 잔차 연결을 포함한다.
- ResWavegram 특징는 다수의 Conv1D Resblock을 스택하여 원시 음성의 장기 및 단기 시간 패턴을 동시에 포착한다.
- 추출된 ResWavegram은 최종적으로 가짜 또는 진짜 음성을 분류하기 위해 ResNet34 백본에 입력된다.
- 전체 모델은 수작업 특징 엔지니어링 없이 엔드 투 엔드로 훈련된다.
- 모델은 파형 도메인에서 직접 표현을 학습함으로써 FFT 기반 특징에서 발생하는 위상 정보 손실을 방지한다.
실험 결과
연구 질문
- RQ1원시 파형에 직접 훈련된 딥 러닝 모델은 LFCC나 CQCC와 같은 수작업 특징에 의존하는 전통적인 가짜 위조 방지 시스템을 능가할 수 있는가?
- RQ21D 컨볼루션 블록에 잔차 연결을 도입함으로써 원시 음성에서의 특징 추출 성능이 향상되는가?
- RQ3원시 파형에서 유도된 학습 가능한 시간-주파수 표현(ResWavegram)은 표준 스펙트로그램 유사 특징보다 더 높은 성능을 달성할 수 있는가?
- RQ4엔드 투 엔드로 훈련된 원시 파형 기반 모델은 ASVspoof2019 LA 데이터셋에서 EER과 t-DCF 측면에서 수작업 특징을 사용하는 시스템과 비교해 어떻게 성능을 내는가?
- RQ5제안된 RW-ResNet 모델은 ASVspoof2019 챌린지의 최상위 융합 시스템과 경쟁하거나 승리할 수 있는가?
주요 결과
- RW-ResNet 모델은 ASVspoof2019 LA 평가 세트에서 2.98%의 동등 오류율(EER)을 기록하여 최고의 베이스라인(LFCC-GMM)의 8.09% EER을 크게 능가한다.
- 모델은 터널 감지 비용 함수(t-DCF)를 0.0817로 기록하여 최고의 베이스라인(0.212 t-DCF) 대비 61% 향상된 성능을 보였다.
- Conv1D Resblock에서 유도된 ResWavegram 특징는 모든 설정에서 기준 Wavegram 특징 대비 약 12% 향상된 EER 성능을 기록한다.
- ResWavegram-M 구성에서 (C1,C2,C3) = (64,128,128)일 경우 최고 성능을 기록하여 EER 2.98%와 t-DCF 0.0817을 달성한다.
- 제안된 RW-ResNet 모델은 ASVspoof2019 챌린지에 기재된 모든 단일 시스템 베이스라인을 압도하며, S3-RawNet2(5.13% EER)와 LFCC-Siamese CNN(3.79% EER)를 모두 뛰어넘는다.
- 단일 시스템임에도 불구하고, 최상위 T05 시스템를 제외한 ASVspoof2019 챌린지의 상위 5개 융합 시스템을 모두 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.