[논문 리뷰] Unsupervised Speech Decomposition via Triple Information Bottleneck
SpeechSplit은 세 가지 전문 정보 병목을 사용하여 음성을 콘텐츠(content), 음색(timbre), 피치(pitch), 리듬(rhythm)으로 분리하는 비지도(autoencoder) 방식의 인코더-디코더이며, 텍스트 라벨 없이 네 가지 구성 요소 모두에 대해 맹목적 스타일 전송을 가능하게 한다.
Speech information can be roughly decomposed into four components: language content, timbre, pitch, and rhythm. Obtaining disentangled representations of these components is useful in many speech analysis and generation applications. Recently, state-of-the-art voice conversion systems have led to speech representations that can disentangle speaker-dependent and independent information. However, these systems can only disentangle timbre, while information about pitch, rhythm and content is still mixed together. Further disentangling the remaining speech components is an under-determined problem in the absence of explicit annotations for each component, which are difficult and expensive to obtain. In this paper, we propose SpeechSplit, which can blindly decompose speech into its four components by introducing three carefully designed information bottlenecks. SpeechSplit is among the first algorithms that can separately perform style transfer on timbre, pitch and rhythm without text labels. Our code is publicly available at https://github.com/auspicious3000/SpeechSplit.
연구 동기 및 목표
- 음성에서 콘텐츠, 리듬, 피치, 음색을 단순한 음색 이해를 넘어서 분리해야 할 필요성을 제시합니다.
- 세 가지 인코더와 타깃 병목을 갖춘 비지도 오토인코더 프레임워크(SpeechSplit)를 제안하여 네 가지 음성 구성요소를 분리합니다.
- 텍스트 주석에 의존하지 않고도 서로 다른 구성 요소를 전환하거나 수정할 수 있음을 보여줍니다.
- 정보 병목 원리를 활용하여 분리를 유도하고 일반적 표현 학습에 대한 통찰을 제공합니다.
제안 방법
- 세 가지 인코더(콘텐츠, 리듬, 피치)와 디코더를 도입하고 각 인코더 출력에 정보 병목을 둡니다.
- 콘텐츠와 피치 인코더에 무작위 시간 도메인 재샘플링을 적용하여 리듬 정보를 오염시키고 병목을 만듭니다.
- 디코더에 세 가지 코드와 화자 иден티티를 입력하여 스펙트로그램을 재구성하고, 특정 가정 하에서 맹목적 분해를 가능하게 합니다.
- 디코딩된 스펙트로그램에서 파형 재구성을 위해 AutoVC와 같은 웨이브넷 보코더를 사용합니다.
- 텍스트 라벨 없이 VCTK에서 학습하고, 주관적 MOS와 객관적 음정 지표(GPE, VDE, FFE)로 평가합니다.
실험 결과
연구 질문
- RQ1텍스트 전사 없이 비지도 설정에서 음성 구성요소인 콘텐츠, 리듬, 피치, 음색을 분리할 수 있는가?
- RQ2세 가지 전용 병목이 분리된 인코더가 서로 다른 구성요소(C, R, F)를 포착하도록 강요하는가, 반면 음색 정보는 디코더로 따로 제공되는가?
- RQ3병렬 데이터나 라벨 없이도 SpeechSplit이 독립적 또는 결합된 스타일 전송(리듬, 피치, 음색)을 수행할 수 있는가?
- RQ4피치만의 변환과 다른 변환 간의 주관적 및 객관적 성능 특성은 AutoVC와 비교할 때 어떠한가?
주요 결과
- SpeechSplit은 스펙트로그램과 피치 곡선에서 리듬, 피치, 음색의 거의 분리된 조작을 가능하게 한다.
- 피치-전용 변환은 목표 곡선에 대한 피치 정렬을 측정 가능하게 달성한다(GPE ~1.04%, VDE ~8.14%, FFE ~8.86%).
- 주관적 MOS는 구성요소에 따라 난이도가 다름을 시사하며 피치 변환이 음색이나 리듬보다 일반적으로 더 높은 품질을 보인다.
- 다양한 변환 유형에서 세 가지 구성 요소를 모두 변환하는 경우 품질이 단일 구성요소 변환보다 낮아지며 AutoVC는 여전히 음색 중심의 기준선으로 남아 있다.
- 비일치 콘텐츠 리듬 변환은 콘텐츠/피치 매핑과 리듬을 맞추는 고정화/빈칸 채우기 메커니즘을 보인다.
- 한 구성요소를 제거(인코더 입력을 0으로 제거)하면 리듬이 제거될 때의 빈 스펙트로그램처럼 해석 가능한 손실 패턴이 나타난다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.