Skip to main content
QUICK REVIEW

[논문 리뷰] EmoFake: An Initial Dataset for Emotion Fake Audio Detection

Yan Zhao, Jiangyan Yi|arXiv (Cornell University)|2022. 11. 10.
Music and Audio Processing인용 수 4
한 줄 요약

이 논문은 실감 나는 감정 음성과 일곱 가지 오픈소스 감정 음성 변환(EVC) 모델을 사용해 생성된 가짜 음성으로 구성된, 감정 가짜 음성 탐지 분야에서 최초로 공개된 데이터셋인 EmoFake를 소개한다. 또한 깊이 있는 감정 임베딩을 사용하는 그래프 주의망(GAT) 기반의 GADE 모델을 제안하며, 이는 목표 감정 탐지에서 EER 0.51%의 최신 기술 수준(SOTA) 성능을 달성하여 기존 모델들을 능가한다.

ABSTRACT

Many datasets have been designed to further the development of fake audio detection, such as datasets of the ASVspoof and ADD challenges. However, these datasets do not consider a situation that the emotion of the audio has been changed from one to another, while other information (e.g. speaker identity and content) remains the same. Changing the emotion of an audio can lead to semantic changes. Speech with tampered semantics may pose threats to people's lives. Therefore, this paper reports our progress in developing such an emotion fake audio detection dataset involving changing emotion state of the origin audio named EmoFake. The fake audio in EmoFake is generated by open source emotion voice conversion models. Furthermore, we proposed a method named Graph Attention networks using Deep Emotion embedding (GADE) for the detection of emotion fake audio. Some benchmark experiments are conducted on this dataset. The results show that our designed dataset poses a challenge to the fake audio detection model trained with the LA dataset of ASVspoof 2019. The proposed GADE shows good performance in the face of emotion fake audio.

연구 동기 및 목표

  • 감정만 변경되고 발화자 신원과 내용은 그대로 유지되는 감정 조작 가짜 음성에 초점을 맞춘 데이터셋의 부족을 해결하기 위해.
  • 음성에서 감정 조작으로 인한 의미적 위험을 포괄하는 벤치마크 데이터셋을 개발하기 위해.
  • 기존의 가짜 음성 탐지 모델이 감정 가짜 음성에 대해 얼마나 견고한지 평가하기 위해.
  • 감정 가짜 음성에 특화된 새로운 탐지 방법인 GADE를 제안하고 검증하기 위해.
  • 향후 감정 인식 가짜 음성 탐지 연구를 가속화하기 위해 EmoFake에서 학습된 기준 모델을 제공하기 위해.

제안 방법

  • EmoFake는 ESD 데이터셋에서 유래되었으며, 남성 및 여성 각 5명의 발화자로 구성되며, 각 발화자는 중립, 기쁨, 분노, 슬픔, 놀람의 다섯 가지 감정에서 350개 문장을 발화한다.
  • 가짜 음성은 일곱 가지 오픈소스 EVC 모델을 사용해 생성되었다: VAW-GAN-CWT, DeepEST, Seq2seq-EVC, CycleGAN-EVC, CycleTransGAN, EmoCycleGAN, StarGAN-EVC.
  • GADE는 사전 훈련된 감정 인식 시스템에서 추출한 깊이 있는 감정 임베딩을 활용하여 문장 간 관계를 모델링하고, 그래프 주의망을 적용한다.
  • 이 모델은 음성 시퀀스 내의 장거리 의존성과 감정 일관성 없는 부분을 포착하기 위해 그래프 기반 아키텍처를 사용한다.
  • 감정 임베딩은 그래프의 노드 특성으로 사용되며, 주의 메커니즘을 통해 다양한 문장의 중요도를 가중치로 설정하여 가짜 음성 탐지에 활용된다.
  • 프레임워크는 EmoFake 데이터셋에서 엔드 투 엔드로 훈련되며, 미리 보지 못한 감정 전환 및 EVC 모델 유형에 대해 평가된다.

실험 결과

연구 질문

  • RQ1감정만 변경된 감정 가짜 음성에서 기존의 가짜 음성 탐지 모델 성능은 어떻게 저하되는가?
  • RQ2표준 탐지 모델을 가장 효과적으로 속이기 위해 어떤 감정 음성 변환(EVC) 모델이 가장 낮은 탐지 가능성을 가진다?
  • RQ3감정 가짜 음성에 특화된 모델인 GADE가 일반 목적의 가짜 음성 탐지기보다 성능이 뛰어나게 되는가?
  • RQ4목표 감정의 선택이 감정 가짜 음성 탐지 가능성에 어떤 영향을 미치는가?
  • RQ5기존 모델을 EmoFake 데이터셋에 맞춰 미세조정하면 감정 기반 조작에 대한 견고성이 얼마나 향상되는가?

주요 결과

  • ASVspoof 2019의 LA 데이터셋은 EmoFake로 일반화되지 않으며, 테스트된 모든 모델이 감정 가짜 음성에서 EER가 증가함을 보여, 성능 저하가 심각하게 나타났다.
  • GADE는 목표 감정이 'Surprise'일 때 EER 0.51%를 기록했으며, 'Happy'일 땐 0.55%를 기록하여 모든 기준 모델을 능가했다.
  • LCNN는 ResNet34와 SENet보다 감정 가짜 음성에 대해 더 뛰어난 견고성을 보였으며, 모든 감정 전환에서 성능 저하가 심각하게 발생했다.
  • Seq2seq-EVC 모델(S3)이 생성한 가짜 음성이 가장 탐지하기 어려웠으며, 이는 EVC 모델의 아키텍처 차이가 탐지 가능성에 영향을 미친다는 것을 시사한다.
  • EmoFake 데이터셋에 대해 미세조정된 기준 모델은 일반화 능력 향상이 뚜렷했으며, 특히 GADE는 모든 감정 전환에서 강력한 성능 유지를 보였다.
  • 감정 탐지 모델의 성능은 목표 감정에 따라 크게 달라지며, 'Surprise'는 RawNet2에서 최대 EER 7.26%까지 상승하여 가장 탐지가 쉬운 감정으로 나타났고, 'Happy'와 'Surprise'는 SENet과 ResNet34에게 가장 도전적인 감정이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.