Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Learning Fine-Grained Disentangled Representations from Speech

Yuan Gong, Christian Poellabauer|arXiv (Cornell University)|2018. 08. 08.
Speech Recognition and Synthesis참고 문헌 17인용 수 3
한 줄 요약

이 논문은 지도 학습 방법을 제안하여 음성에서 세분화되고 분리된 표현을 학습한다. 각 잠재 코드에 포함된 의도하지 않은 정보를 억제하기 위해 요소별 예측기로 다중 오토인코더를 훈련시킨다. 지도 학습에서 진정한 레이블 대신 예측의 확실성을 정규화 기법으로 사용함으로써, 감정, 성별, 내용과 같은 여러 음성 요소들 간의 분리가 가능해지며, 데이터셋에 완전한 레이블이 없더라도 가능하다.

ABSTRACT

Learning disentangled representations of high-dimensional data is currently an active research area. However, compared to the field of computer vision, less work has been done for speech processing. In this paper, we provide a review of two representative efforts on this topic and propose the novel concept of fine-grained disentangled speech representation learning.

연구 동기 및 목표

  • 음성 처리에서 세분화되고 분리된 표현의 부족을 해결함으로써, 후속 작업에서의 해석 가능성과 성능 향상에 기여하고자 한다.
  • 감정과 화자 신원과 같은 여러 요소를 하나의 잠재 변수에 묶는 굵은 분리 방법의 한계를 극복하고자 한다.
  • 내용, 감정, 성별, 연령과 같은 다수의 독립된 음성 요소를 약한 레이블이 있는 데이터셋을 사용하여 분리할 수 있는 확장 가능한 프레임워크를 개발하고자 한다.
  • 모든 요소에 대한 완전한 레이블이 확보되지 않은 저자원 환경에서도 분리를 가능하게 하고자 한다.

제안 방법

  • 논문 [7]의 대비적 분리 프레임워크를 다중 요소로 확장하기 위해, 각각 특정 음성 요소를 목표로 하는 n개의 별도 오토인코더를 훈련시킨다.
  • 각 오토인코더에 대해 나머지 요소들 각각을 잠재 코드에서 분류하는 n−1개의 보조 예측기를 훈련시으며, 관련이 없는 요소의 예측 신뢰도를 최소화함으로써 분리를 강제한다.
  • 예측 신뢰도 손실의 최소값(하이퍼파라미터 λj로 스케일링됨)을 오토인코더의 목적 함수에 정규화 기법으로 사용한다: Li = Lrec − minj≠i(λjLij).
  • 훈련 중에 진정한 레이블 대신 예측의 확실성(예: max P(yk|z))을 사용하여, 완전한 레이블이 없는 데이터셋에서도 사용 가능하다.
  • 진정한 레이블 대신 예측된 레이블을 디코더에 입력하여 입력을 재구성함으로써, 인코더에 의해 제거된 정보를 보완한다.
  • 오토인코더와 예측기의 훈련을 번갈아가며 수행함으로써, 잠재 코드가 관련 없는 요소에 대해 강건해지면서도 목표 요소는 유지되도록 한다.

실험 결과

연구 질문

  • RQ1데이터셋에서 모든 요소에 대해 완전한 레이블이 없더라도, 내용, 감정, 성별, 연령과 같은 세분화된 음성 요소의 분리된 표현을 학습할 수 있는가?
  • RQ2완전한 레이블 감독에 의존하지 않는 지도 학습 프레임워크를 통해 다수의 독립된 음성 요소 간의 분리를 어떻게 달성할 수 있는가?
  • RQ3완전한 레이블이 없는 상황에서 진정한 레이블 대신 예측의 확실성을 정규화 기법으로 사용할 경우의 영향은 무엇인가?
  • RQ4여러 개의 약한 레이블이 있는 데이터셋을 함께 사용하여 공통의 요소별 오토인코더 프레임워크를 통해 분리된 표현을 학습할 수 있는가?

주요 결과

  • 제안된 방법은 예측의 확실성을 정규화 기법으로 사용함으로써 부분적인 레이블만으로도 다수의 음성 요소(예: 내용, 감정, 성별)를 분리할 수 있다.
  • 확실성 기반 정규화를 사용함으로써, 제거된 요소에 대한 진정한 레이블이 없더라도 훈련이 가능해지며, 레이블이 제한된 실세계 데이터셋에 적용 가능해진다.
  • 기존 연구 [7]을 확장하여 언어적 및 비언어적 특성에 걸쳐 두 요소 분리(내용 대비 화자)에서 다중 요소 분리로 일반화하였다.
  • 예측된 레이블을 디코더에 입력함으로써 재구성 품질을 유지함으로써, 인코더에 의해 제거된 정보를 보완한다.
  • 이 방법은 다수의 요소로 확장 가능하며, 공통의 음성 요소를 공유하는 다양한 데이터셋에 적용 가능하며, 레이블이 불완전하더라도 적용 가능하다.
  • 실험적 검증을 통해 학습된 표현이 분리되어 있으며 해석 가능하며, 음성 합성 및 인식과 같은 후속 작업의 성능 향상 잠재력을 지닌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.