[논문 리뷰] Voice Conversion using Convolutional Neural Networks
이 논문은 깊이 있는 시각적 유사성 네트워크(VAN)와 일정 Q-변환(CQT) 특징을 결합한 조건부 생성 적대적 네트워크(cGAN)를 사용하여 화자 톤을 언어적 내용에서 분리하는 음성 변환 방법을 제안한다. 모델은 말하는 단어를 유지하면서 화자 톤을 전이하는 방식으로 청각적으로 타당한 음성 변환을 달성하지만, 복원 단계에서의 업샘플링으로 인해 주파수 해상도가 제한되어 있다.
The human auditory system is able to distinguish the vocal source of thousands of speakers, yet not much is known about what features the auditory system uses to do this. Fourier Transforms are capable of capturing the pitch and harmonic structure of the speaker but this alone proves insufficient at identifying speakers uniquely. The remaining structure, often referred to as timbre, is critical to identifying speakers but we understood little about it. In this paper we use recent advances in neural networks in order to manipulate the voice of one speaker into another by transforming not only the pitch of the speaker, but the timbre. We review generative models built with neural networks as well as architectures for creating neural networks that learn analogies. Our preliminary results converting voices from one speaker to another are encouraging.
연구 동기 및 목표
- 화자 정체성(톤)과 언어적 내용을 분리하는 신경망 기반 음성 변환 방법을 개발하는 것.
- 수작업으로 설계된 청각 모델을 피하기 위해 신경망이 톤 전이의 변환 연산자를 학습할 수 있는지 탐색하는 것.
- 수작업으로 만든 특징 대신 엔드 투 엔드 학습을 통해 이전 연구를 향상시키는 것.
- 조건부 GAN이 화자 특수성에 따라 음성 특징을 모델링하면서도 단어 정체성을 유지하는 데의 가능성을 탐구하는 것.
제안 방법
- 모델은 원시 음성을 인간 청각 처리 방식을 모방하는 로그 주파수 표현으로 변환하기 위해 일정 Q-변환(CQT)을 사용한다.
- 심층 시각적 유사성 네트워크(VAN)를 생성기로 사용하여 '원본 화자 음성은 목표 화자 음성과 같고, 입력 단어는 출력 단어와 같다'는 유사성 문제를 해결하는 맵핑을 학습한다.
- 생성기는 조건부 GAN 프레임워크에서 학습되며, 판별기는 실제 및 생성된 CQT 특징을 화자와 단어 정체성에 따라 분류한다.
- 목적 함수는 적대적 손실을 최소화하면서도 생성기가 실제 데이터의 화자 및 단어 카테고리와 일치하는 CQT를 생성하도록 유도한다.
- 학습 중에 반반 비율로 생성기에서 샘플을 추출하는 비편향 샘플링 전략을 사용하여 가짜 화자 및 단어를 더 잘 식별하도록 한다.
- 모델은 서로 다른 화자가 같은 단어를 읽는 것을 재구성하도록 톤과 내용의 분리된 표현을 학습한다.
실험 결과
연구 질문
- RQ1심층 신경망은 말하는 단어를 유지하면서 한 화자에서 다른 화자로 톤을 전이할 수 있는가?
- RQ2VAN 기반 생성기를 사용한 조건부 GAN은 청각적으로 타당한 음성 변환을 얼마나 잘 재현할 수 있는가?
- RQ3원시 파형이나 표준 푸리에 변환 대비 CQT 특징을 사용할 경우 톤 분리에 얼마나 기여하는가?
- RQ4주파수 해상도와 청각 품질 측면에서 현재 접근법의 한계는 무엇인가?
- RQ5VAN과 GAN 아키텍처의 조합은 음성 변환 문제를 분리 문제로 모델링하는 데 얼마나 효과적인가?
주요 결과
- 모델은 말하는 단어를 유지하면서 한 화자에서 다른 화자로 톤을 성공적으로 전이하여 청각적으로 타당한 음성 변환을 생성한다.
- 생성된 오디오가 목표 화자의 조화 성분을 잘 반영하여 스펙트럼 응답과 피치 특징을 효과적으로 학습한 것으로 나타났다.
- 생성된 신호의 주파수 해상도는 제한되어 있으며, 복원 단계에서의 업샘플링으로 인한 것으로 보인다.
- 단일 화자와 네 단어로 구성된 작은 학습 세트에서도 모델이 잘 작동하여 더 많은 데이터로 일반화 가능성이 있음을 시사한다.
- 오디오 샘플을 통해 모델이 목표 화자와 청각적으로 유사한 말을 생성할 수 있음을 확인했지만, 항상 구분되지 않는 것은 아니다.
- 조건부 GAN의 학습은 여전히 도전적이며, 저자들은 안정적이고 고품질의 결과를 얻기 위해 향후 최적화가 필요하다고 지적한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.