Skip to main content
QUICK REVIEW

[논문 리뷰] StarGAN-based Emotional Voice Conversion for Japanese Phrases

Asuka Moritani, Ryo Ozaki|arXiv (Cornell University)|2021. 04. 05.
Speech Recognition and Synthesis참고 문헌 17인용 수 6
한 줄 요약

이 논문은 스펙트럼 엔벨롭 변환을 통해 StarGAN-VC를 활용한 비병렬, 다대다 감정 음성 변환 방법인 StarGAN-EVC를 제안한다. 기본 주파수(F0)와 비정규성 처리를 최소화한다. 주관적 평가 결과, 중간 수준의 감정 변환 성능를 달성하지만, 특히 '슬픔' 발화에서 자연스러움이 감정 상태에 따라 크게 변동된다.

ABSTRACT

This paper shows that StarGAN-VC, a spectral envelope transformation method for non-parallel many-to-many voice conversion (VC), is capable of emotional VC (EVC). Although StarGAN-VC has been shown to enable speaker identity conversion, its capability for EVC for Japanese phrases has not been clarified. In this paper, we describe the direct application of StarGAN-VC to an EVC task with minimal fundamental frequency and aperiodicity processing. Through subjective evaluation experiments, we evaluated the performance of our StarGAN-EVC system in terms of its ability to achieve EVC for Japanese phrases. The subjective evaluation is conducted in terms of subjective classification and mean opinion score of neutrality and similarity. In addition, the interdependence between the source and target emotional domains was investigated from the perspective of the quality of EVC.

연구 동기 및 목표

  • 비병렬 훈련 데이터가 필요하지 않은 상황에서, 원래 말소리 신원 변환을 위해 설계된 StarGAN-VC가 일본어 어휘에 대한 감정 음성 변환(EVC)에 직접 적용될 수 있는지 조사한다.
  • F0와 비정규성 처리를 최소화한 상황에서 스펙트럼 엔벨롭 변환만으로 EVC를 달성할 수 있는지 평가한다.
  • 감정 분류, 자연스러움(MOS), 감정 유사도(ESS)에 중점을 두어 주관적 听음 테스트를 통해 제안된 StarGAN-EVC 시스템의 성능을 평가한다.
  • 특히 이중 방향 변환 품질과 성능의 비대칭성에 주목하여, 원천과 대상 감정 도메인 간의 상호의존성을 분석한다.
  • StarGAN-VC를 F0 및 비정규성 처리 기법과 융합하여 전체 변환 품질과 자연스러움을 향상시킬 잠재력을 탐색한다.

제안 방법

  • 감정 상태를 도메인으로 간주하여, 생성적 적대적 네트워크(GANs) 기반의 비병렬 다대다 음성 변환 프레임워크인 StarGAN-VC를 감정 음성 변환(EVC)에 적응시킨다.
  • 스펙트럼 엔벨롭 변환을 EVC의 주요 메커니즘으로 사용하며, F0에는 로그 정규화를, 비정규성에는 아이덴티티 매핑을 적용하여 프로소디크 및 스펙트럼 특성을 유지한다.
  • 입력 음성 특징과 원-핫 인코딩된 대상 감정 레이블을 입력으로 받아 변환된 특징 시퀀스를 생성하는 생성자 네트워크를 활용한다.
  • 생성자와 판별자 간의 적대적 훈련을 수행하며, 판별자는 실제 특징와 생성된 특징를 구분하고, 도메인 분류기는 정확한 도메인 할당을 보장한다.
  • 훈련 안정성과 이중 방향 변환 성능 향상을 위해 사이클 일致성 손실를 적용하지만, 결과의 비대칭성은 완전한 대칭성에 한계가 있음을 시사한다.
  • 비병렬 일본어 어휘 데이터셋에 모델을 적용하여, 감정 상태 간 병렬 발화 없이도 엔드 투 엔드 훈련이 가능하도록 한다.

실험 결과

연구 질문

  • RQ1스펙트럼 엔벨롭 변환만으로 StarGAN-VC를 일본어 어휘의 감정 음성 변환에 효과적으로 적용할 수 있는가?
  • RQ2감정 분류, 자연스러움, 유사도 측면에서 다양한 원천-대상 감정 상태 쌍에 대해 StarGAN-EVC의 성능이 어떻게 변동되는가?
  • RQ3명시적인 F0 및 비정규성 모델링이 부족할 경우, 변환된 음성의 품질과 자연스러움에 어떤 영향을 미치는가?
  • RQ4감정 상태 간에 이중 방향 변환 성능에 비대칭성이 존재하는가? 이러한 비대칭성의 원인은 무엇인가?
  • RQ5스펙트럼 엔벨롭 변환만으로도 청각적으로 만족스러운 감정 음성 변환을 달성할 수 있는가, 아니면 추가적인 프로소디크 수정이 필수적인가?

주요 결과

  • 주관적 평가 결과, StarGAN-EVC는 스펙트럼 엔벨롭 변환만으로도 일본어 어휘의 감정 표현을 성공적으로 변환할 수 있으며, '중립'을 대상으로 할 경우 평균 감정 분류 정확도가 5점 만점에 4.79점으로 나타났다.
  • 자연스러움에 대한 평균 점수(MOS)는 일반적으로 낮았으며, 특히 '슬픔'에서 다른 감정으로의 변환 시 MOS 값이 2.0 이하로 떨어져 낮은 청취자 평가를 받았다.
  • большин의 쌍에 대해 감정 유사도 점수(ESS)는 MOS 점수보다 높았으며, 이는 감정 의도는 자주 인식되었지만 음성 품질은 자연스럽지 않다고 평가된다는 것을 시사한다.
  • 시스템은 성능에 심각한 비대칭성을 보였다: '슬픔'에서 다른 감정으로의 변환은 낮은 MOS를 보였지만, '기쁨'에서 '슬픔'으로의 변환은 높은 MOS를 기록하여, 모델의 일반화 능력이 감정 상태 간에 대칭적이지 않음을 나타냈다.
  • '슬픔'에서 '중립'으로의 변환에서 가장 높은 ESS(4.92)를 기록하여, 자연스러움이 손상된 상황에서도 감정의 일치성을 유지할 수 있음을 보여주었다.
  • 결과적으로 스펙트럼 엔벨롭 변환이 감정 이행에 효과적임을 확인했지만, 명시적인 F0 및 비정규성 모델링 부재로 인해 특히 '슬픔'과 같은 감정 상태 간에 뚜렷한 감정적 차이를 보이는 경우 전체 자연스러움이 제한됨을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.