Skip to main content
QUICK REVIEW

[논문 리뷰] Generative Adversarial Networks for Unpaired Voice Transformation on Impaired Speech

Li-Wei Chen, Hung-yi Lee|arXiv (Cornell University)|2018. 10. 30.
Speech Recognition and Synthesis참고 문헌 27인용 수 5
한 줄 요약

이 논문은 병렬 훈련 데이터가 필요 없이, 손상된 말소리를 더 명료하고 이해하기 쉬운 정상 말소리로 변환하는 새로운 GAN 기반의 종단간(end-to-end), 비지도(unsupervised) 음성 변환 모델을 제안한다. 이 방법은 손상된 말소리를 콘텐츠-음성 코드로 매핑하는 컨트롤러를 사용하며, 생성기(generator)는 이를 바탕으로 자연스럽고 화자 유지가 가능한 음성을 합성한다. 이는 CycleGAN에 비해 이해도와 화자 특성 유지 측면에서 모두 뛰어난 성능을 보인다.

ABSTRACT

This paper focuses on using voice conversion (VC) to improve the speech intelligibility of surgical patients who have had parts of their articulators removed. Due to the difficulty of data collection, VC without parallel data is highly desired. Although techniques for unparallel VC, for example, CycleGAN, have been developed, they usually focus on transforming the speaker identity, and directly transforming the speech of one speaker to that of another speaker and as such do not address the task here. In this paper, we propose a new approach for unparallel VC. The proposed approach transforms impaired speech to normal speech while preserving the linguistic content and speaker characteristics. To our knowledge, this is the first end-to-end GAN-based unsupervised VC model applied to impaired speech. The experimental results show that the proposed approach outperforms CycleGAN.

연구 동기 및 목표

  • 언어 기관 절제로 인한 발음 장애를 가진 수술 환자의 말소리 이해도 향상 문제를 해결하기 위해.
  • 손상된 말소리와 정상 말소리 간의 병렬 훈련 데이터 부족 문제를 해결하기 위해, 비지도, 비병렬 음성 변환을 가능하게 하기 위해.
  • 변환 과정에서 언어적 콘텐츠와 화자 특성에 대한 유지 보장을 통해 화자 정체성과 자연스러움을 유지하기 위해.
  • 기존의 GAN 기반 접근 방식(예: CycleGAN)보다 화자 정체성 유지와 발음 개선 측면에서 뛰어난 성능을 보이는 방법을 개발하기 위해.

제안 방법

  • 생성기 G, 판별기 D, 컨트롤러 C로 구성된 세 부분으로 이루어진 아키텍처를 사용하며, 적대적 프레임워크 내에서 종단간(end-to-end)으로 훈련한다.
  • 생성기 G는 콘텐츠 코드 c로부터 정상 말소리를 생성하며, 판별기 D는 실제 정상 말소리와 생성된 샘플을 구분한다.
  • 컨트롤러 C는 입력된 손상된 말소리를 콘텐츠 코드 c로 매핑하며, 이 코드는 G가 언어적 특성과 화자 특성을 유지한 채 자연스러운 말소리를 생성하는 데 사용된다.
  • 저수준의 신호 차이 대신 판별기의 은닉층을 활용한 인지 기반 손실을 도입하여, 손상된 말소리와 생성된 말소리 간의 고수준 유사도를 평가한다.
  • 생성기와 판별기는 대규모 정상 말소리 데이터셋에서 훈련되며, 컨트롤러는 손상된 말소리 전용으로 훈련되어 고수준 유사도를 최소화한다.
  • 컨트롤러 손실을 포함한 수정된 적대적 손실을 사용하여, 컨트롤러가 실제 정상 말소리와 구분이 가지 않는 콘텐츠와 화자 정체성 유지가 가능한 코드를 생성하도록 유도한다.

실험 결과

연구 질문

  • RQ1병렬 훈련 데이터 없이도 GAN 기반의 비병렬 음성 변환 모델이 손상된 말소리의 이해도 향상에 효과적으로 기여할 수 있는가?
  • RQ2제안된 모델이 변환 과정에서 손상된 말소리의 언어적 콘텐츠와 화자 정체성을 얼마나 잘 유지하는가?
  • RQ3사이클 일관성 손실 대비 인지 기반 손실(판별기 특징을 통한)이 콘텐츠와 화자 일관성을 유지하는 데 어떤 영향을 미치는가?
  • RQ4왜 CycleGAN은 이 특정한 손상된 말소리 환경에서는 화자 정체성과 언어적 콘텐츠를 유지하지 못하는가?
  • RQ5생성기와 컨트롤러의 공동 훈련 대비 컨트롤러 기반 아키텍처가 훈련 안정성과 음성 품질 측면에서 어떻게 비교되는가?

주요 결과

  • 제안된 모델은 발음에 대한 평균 관점 평가 점수(MOS)가 59.4%를 기록하여, CycleGAN(33.2%)과 cGAN(41.4%)을 크게 앞서며 더 뛰어난 이해도 향상을 보였다.
  • 화자 특성 유사도 MOS는 56.4%, 언어적 콘텐츠 유사도 MOS는 60.2%로, 각각 CycleGAN의 32.4%와 37.4%보다 뚜렷이 높아, 화자 정체성과 콘텐츠 유지 측면에서 더 나은 성능을 보였다.
  • 제거 실험(Ablation study) 결과, 판별기의 확장된 입력을 제거한 경우(NoSD) 컨트롤러 및 판별기 손실이 증가하여 생성기 품질 저하와 더 흐릿한 스펙트로그램이 발생함을 확인하였다.
  • 생성기와 컨트롤러의 공동 훈련(C&G)은 판별기 손실이 급격히 0으로 떨어지며 생성기 품질이 열악하고 현실감 있는 출력을 생성하지 못함을 시사한다.
  • CycleGAN은 스테고그래픽(steganographic) 행동을 보이며, 목표 도메인에 원본 입력 정보를 유지함으로써 순환 복원 시 높은 재구성 정밀도를 보이며, 이는 콘텐츠와 화자 일관성의 훼손을 초래한다.
  • 컨트롤러가 판별기 특징을 통한 고수준 유사도를 활용함으로써, 인지적으로 중요한 차원에서 손상된 말소리와 생성된 말소리 간의 차이를 효과적으로 최소화하였으며, 이는 사이클 일관성 손실이 콘텐츠 및 화자 유지 조건을 충족시키지 못하는 데 비해 유의미한 성과를 거두었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.