Skip to main content
QUICK REVIEW

[논문 리뷰] ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech

Xin Wang, Junichi Yamagishi|arXiv (Cornell University)|2019. 11. 05.
Speech Recognition and Synthesis참고 문헌 52인용 수 10
한 줄 요약

이 논문은 합성, 변환, 재생된 음성 데이터를 포함한 대규모 공개 데이터셋인 ASVspoof 2019 데이터베이스를 소개한다. 이는 논리적 접근과 물리적 접근 시나리오를 모두 포함한다. 최신 기술의 음성 변조 공격을 자동화된 ASV 및 대응 조치 시스템, 그리고 인간 평가를 통해 평가하였으며, 일부 합성 음성은 인간 청취자에게도 실제 음성과 구분되지 않을 정도로 높은 수준임을 입증하였다. 이는 화자 인증 시스템의 심각한 취약성을 드러낸다.

ABSTRACT

Automatic speaker verification (ASV) is one of the most natural and convenient means of biometric person recognition. Unfortunately, just like all other biometric systems, ASV is vulnerable to spoofing, also referred to as "presentation attacks." These vulnerabilities are generally unacceptable and call for spoofing countermeasures or "presentation attack detection" systems. In addition to impersonation, ASV systems are vulnerable to replay, speech synthesis, and voice conversion attacks. The ASVspoof 2019 edition is the first to consider all three spoofing attack types within a single challenge. While they originate from the same source database and same underlying protocol, they are explored in two specific use case scenarios. Spoofing attacks within a logical access (LA) scenario are generated with the latest speech synthesis and voice conversion technologies, including state-of-the-art neural acoustic and waveform model techniques. Replay spoofing attacks within a physical access (PA) scenario are generated through carefully controlled simulations that support much more revealing analysis than possible previously. Also new to the 2019 edition is the use of the tandem detection cost function metric, which reflects the impact of spoofing and countermeasures on the reliability of a fixed ASV system. This paper describes the database design, protocol, spoofing attack implementations, and baseline ASV and countermeasure results. It also describes a human assessment on spoofed data in logical access. It was demonstrated that the spoofing data in the ASVspoof 2019 database have varied degrees of perceived quality and similarity to the target speakers, including spoofed data that cannot be differentiated from bona-fide utterances even by human subjects.

연구 동기 및 목표

  • 자동 화자 인증(ASV) 시스템에서 음성 변조 대응 기술 평가를 위한 종합적 벤치마크를 개발하기 위해.
  • 텍스트에서 음성으로의 합성, 음성 변환, 재생 공격와 같은 세 가지 주요 음성 변조 공격에 대한 ASV 시스템의 취약성을 해결하기 위해.
  • 학술 및 산업 연구를 위해 기준이 되는 공개 가능 데이터셋을 제공하고, 정답 레이블과 메타데이터를 포함하기 위해.
  • 자동 평가 지표(EER)와 인간 평가를 모두 활용하여 ASV 및 대응 조치 시스템의 성능을 평가하기 위해.
  • 특히 물리적 접근 시나리오에서 제어된 음향 조건 하에서 음성 변조 공격의 효과성을 체계적으로 분석할 수 있도록 하기 위해.

제안 방법

  • 데이터베이스는 최신 신경 음향 및 웨이브폼 모델을 사용하여 생성된 변조된 음성 포함한다. 이는 Tacotron2, WaveNet, WaveRNN 등을 활용한 텍스트에서 음성으로의 합성 및 음성 변환에 해당한다.
  • 재생 공격는 정밀한 마이크 및 loudspeaker 배치를 통해 제어된 음향 환경에서 시뮬레이션되어 물리적 접근 조건의 세부 분석이 가능하도록 하였다.
  • 두 가지 사용 사례 시나리오를 정의하였다: 합성/변환 음성에 대한 논리적 접근(LA)과 재생 공격에 대한 물리적 접근(PA)이며, 각각 별도의 프로토콜과 평가 지표를 갖는다.
  • ASV 신뢰성에 대한 음성 변조 및 대응 조치의 영향을 평가하기 위해 새로운 지표인 터널 검출 비용 함수(t-DCF)를 도입하였다.
  • 등오차율(EER)과 t-DCF를 사용하여 데이터셋에서 기본 ASV 및 대응 조치(CM) 시스템을 학습하고 평가하여 성능을 분석하였다.
  • 인간 평가를 통해 LA 서브셋에서 변조된 발화의 청취 품질과 대상 화자와의 유사도를 평가하였다.

실험 결과

연구 질문

  • RQ1최신 기술의 텍스트에서 음성으로의 합성 및 음성 변환 시스템은 실제 음성과 구분되지 않을 정도로 변조된 음성을 얼마나 효과적으로 생성할 수 있는가?
  • RQ2제어된 음향 조건 하에서 물리적 접근 시나리오에서의 재생 공격는 ASV 시스템의 신뢰성에 얼마나 큰 영향을 미치는가?
  • RQ3자동화된 ASV 및 대응 조치 시스템은 새로운 데이터셋에서 어떻게 성능을 발휘하며, 그 결과는 인간의 인지와 얼마나 관련이 있는가?
  • RQ4웨이브폼 생성 기법(예: Griffin-Lim 대비 WaveRNN)은 변조된 음성의 청취 품질과 탐지 가능성에 어떤 영향을 미치는가?
  • RQ5최근 도입된 t-DCF 지표는 실제 환경에서의 ASV 시스템 신뢰성에 대해 얼마나 잘 반영하는가?

주요 결과

  • WaveRNN를 사용한 시스템 A10의 변조된 음성은 인간 청취자에게도 실제 음성과 구분되지 않으며, 청취 품질이나 유사도에 유의미한 차이가 없었다(p=0.012 및 p=0.81).
  • 그리프린-림을 사용한 시스템 A11은 낮은 품질의 합성 음성을 생성하였고, 인간에 의해 유의미하게 더 잘 탐지되었다. 이는 웨이브폼 생성 기법이 변조 품질에 결정적인 영향을 미친다는 것을 시사한다.
  • A10과 A11 간의 탐지 가능성 차이는 통계적으로 유의미했다(p<0.001). 이는 웨이브폼 생성 기법이 청취 품질과 탐지 가능성에 모두 영향을 미친다는 것을 확인한다.
  • 인간 평가자들은 A13과 A17의 변조된 데이터를 자동화된 시스템보다 더 쉽게 탐지하였다. 이는 인간 인지와 기본 ASV/CM 성능 사이에 괴리가 있음을 보여준다.
  • t-DCF 지표는 음성 변조 공격가 ASV 시스템에 미치는 신뢰성 영향을 효과적으로 반영하였으며, EER만으로 평가하는 것보다 더 현실적인 평가를 가능하게 하였다.
  • ASVspoof 2019 데이터베이스는 청취적으로 실제 음성과 구분되지 않는 변조된 발화를 포함하고 있으며, 이는 현대의 TTS 및 VC 시스템이 인간과 기계 탐지 모두를 회피할 수 있는 높은 수준의 능력을 지니고 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.