[논문 리뷰] AGAIN-VC: A One-shot Voice Conversion using Activation Guidance and Adaptive Instance Normalization
AGAIN-VC는 단일 인코더와 활성화 지도, 적응형 인스턴스 정규화를 사용하여 화자 및 콘텐츠 표현을 분리하는 일회성 음성 변환 시스템을 제안한다. 콘텐츠 임베딩에 학습 가능한 시그모이드 활성화를 적용하여 연속적이고 소프트한 정보 병목을 형성함으로써, 이중 인코더 모델에 비해 성능을 뛰어넘으면서도 모델 크기를 30% 감소시켜 객관적 및 주관적 평가에서 최고 성능을 달성한다.
Recently, voice conversion (VC) has been widely studied. Many VC systems use disentangle-based learning techniques to separate the speaker and the linguistic content information from a speech signal. Subsequently, they convert the voice by changing the speaker information to that of the target speaker. To prevent the speaker information from leaking into the content embeddings, previous works either reduce the dimension or quantize the content embedding as a strong information bottleneck. These mechanisms somehow hurt the synthesis quality. In this work, we propose AGAIN-VC, an innovative VC system using Activation Guidance and Adaptive Instance Normalization. AGAIN-VC is an auto-encoder-based model, comprising of a single encoder and a decoder. With a proper activation as an information bottleneck on content embeddings, the trade-off between the synthesis quality and the speaker similarity of the converted speech is improved drastically. This one-shot VC system obtains the best performance regardless of the subjective or objective evaluations.
연구 동기 및 목표
- 일회성 음성 변환에서 합성 품질과 화자 콘텐츠 분리성 간의 상충 관계를 해결하기 위해.
- 인스턴스 정규화 레이어의 채널별 평균 μ 및 표준편차 σ를 재사용함으로써 별도의 화자 인코더가 필요 없도록 하기 위해.
- 화자 정보가 콘텐츠 임베딩으로 泄漏되는 것을 방지하기 위해 학습 가능한 소프트 정보 병목으로서 활성화 지도를 도입하기 위해.
- 통합된 단일 인코더 아키텍처를 통해 모델 효율성과 성능을 향상시키기 위해.
- 객관적 지표와 주관적 인간 평가 모두에서 최고 수준의 성능을 달성하기 위해.
제안 방법
- 단일 인코더가 인스턴스 정규화(IN) 레이어를 사용하여 콘텐츠 및 화자 표현을 동시에 추출하며, 채널별 평균 μ 및 표준편차 σ가 화자 임베딩으로 사용된다.
- 적응형 인스턴스 정규화(AdaIN)는 디코딩 중에 타겟 임베딩에서 화자 스타일을 콘텐츠 특징으로 전달한다.
- 활성화 지도는 콘텐츠 임베딩에 하이퍼파라미터 α를 가진 학습 가능한 시그모이드 함수를 적용하여, 화자 정보를 억제하는 연속적이고 소프트한 정보 병목으로 작용한다.
- 모델은 복원 손실을 최소화하도록 훈련된다: ℒ = ||X − X̂||₁, 입력 및 출력 멜스펙트로그램 간의 차이를 최소화한다.
- 활성화 함수는 훈련 중 최적화되며, α = 0.1이 분리성과 복원성 간의 최적 균형을 이끌어내는 것으로 밝혀졌다.
- 별도의 화자 및 콘텐츠 인코더를 피하기 때문에 모델 크기가 감소하면서도 성능은 유지 또는 향상된다.
실험 결과
연구 질문
- RQ1단일 인코더가 일회성 음성 변환에서 화자 및 콘텐츠 표현을 효과적으로 분리할 수 있는가?
- RQ2학습 가능한 시그모이드 함수를 사용한 활성화 지도가 합성 품질을 떨어뜨리지 않고 분리성을 향상시키는가?
- RQ3이중 인코더 기반 모델(예: AdaIN-VC)과 비교해 본다면, 제안된 방법은 성능과 모델 효율성 측면에서 어떻게 다른가?
- RQ4활성화 지도 함수의 최적 하이퍼파라미터 α는 화자 유사성과 콘텐츠 충실도를 균형 잡는 데 어떤가?
- RQ5제안된 방법은 객관적 지표와 주관적 인간 평가 양쪽에서 뛰어난 성능을 달성하는가?
주요 결과
- 제안된 1-Enc-sig 모델은 모든 구성 중에서 가장 낮은 복원 오차(0.151)를 기록했으며, 1-Enc 및 2-Enc 기준선을 모두 초월했다.
- 활성화 지도를 적용한 결과 콘텐츠 임베딩의 화자 분류 정확도는 1.7%로 떨어졌으며, 이는 화자 정보의 거의 완벽한 분리성을 의미한다.
- 화자 임베딩에 대해 93.2%의 화자 분류 정확도를 기록하여 효과적인 화자 표현 학습을 확인했다.
- 주관적 평가 결과 제안된 모델은 자연성(MOS)과 화자 유사도 양 측면에서 가장 높은 점수를 기록했으며, 1-Enc 및 2-Enc 기준선을 크게 앞섰다.
- 단일 인코더 모델은 이중 인코더 버전(13.5M 파라미터) 대비 30%의 모델 크기 감소(9.5M 파라미터)를 이룩했으며, 성능 저하 없이도 유지되었다.
- α = 0.1인 시그모이드 함수가 최적으로 밝혀졌으며, 정보 필터링과 콘텐츠 유지 간의 균형을 잘 잡아, ReLU, ELU, Tanh보다 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.