Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervised Pre-training Reduces Label Permutation Instability of Speech Separation.

Sung-Feng Huang, Shun-Po Chuang|arXiv (Cornell University)|2020. 10. 29.
Speech Recognition and Synthesis참고 문헌 29인용 수 7
한 줄 요약

이 논문은 다중 화자 상황에서의 음성 분리, 특히 다중 화자 분리에 대한 순열 불변 훈련(PIT)에서 발생하는 레이블 순열 불안정성을 안정화하기 위해 자기지도 학습 사전 훈련을 제안한다. 음성 향상 기반 사전 훈련을 활용함으로써, 훈련 시간을 최대 2/3까지 줄일 수 있으며, 사전 훈련 시간을 포함해도 성능을 유지한다. 특히 더 큰 배치 크기를 사용할 경우 더욱 두드러진다.

ABSTRACT

Speech separation has been well-developed while there are still problems waiting to be solved. The main problem we focus on in this paper is the frequent label permutation switching of permutation invariant training (PIT). For N-speaker separation, there would be N! possible label permutations. How to stably select correct label permutations is a long-standing problem. In this paper, we utilize self-supervised pre-training to stabilize the label permutations. Among several types of self-supervised tasks, speech enhancement based pre-training tasks show significant effectiveness in our experiments. When using off-the-shelf pre-trained models, training duration could be shortened to one-third to two-thirds. Furthermore, even taking pre-training time into account, the entire training process could still be shorter without a performance drop when using a larger batch size.

연구 동기 및 목표

  • 다중 화자 음성 분리에 대한 순열 불변 훈련(PIT)에서 지속적인 레이블 순열 불안정성 문제를 해결하기 위해.
  • 자기지도 학습 사전 훈련이 N명의 화자 분리에서 N!가지 가능한 조합 중 정확한 레이블 순열 선택을 안정화하는 데 효과적인지 조사하기 위해.
  • 모델 성능을 유지하거나 향상시키면서 음성 분리의 훈련 기간을 단축시키기 위해.
  • 다양한 자기지도 학습 사전 훈련 과제 중, 특히 음성 향상 기반 방법이 가장 효과적인지 평가하기 위해.

제안 방법

  • 하류 분리 작업에 대한 미세조정 이전에 음성 분리 모델에 자기지도 학습 사전 훈련을 적용하기 위해.
  • 다양한 자기지도 목표 중에서 음성 향상 기반 사전 훈련 과제가 가장 효과적인 형태로 사용하기 위해.
  • 순열 불변 훈련(PIT)을 통해 사전 훈련된 모델을 음성 분리 작업에 대해 미세조정하기 위해.
  • 수집된 사전 훈련 모델을 활용하여 수렴 속도를 가속화하고 훈련 시간을 단축시키기 위해.
  • 더 큰 배치 크기를 사용하여 미세조정 중에 훈련 기간을 추가로 단축시키기 위해, 사전 훈련 시간을 포함한 총 훈련 시간이 기준 훈련보다 짧아지도록 하기 위해.

실험 결과

연구 질문

  • RQ1자기지도 학습 사전 훈련은 다중 화자 음성 분리에서 레이블 순열 불안정성을 줄일 수 있는가?
  • RQ2자기지도 학습 사전 훈련 과제 중 어떤 유형이 음성 분리에서 레이블 순열 안정화에 가장 효과적인가?
  • RQ3사전 훈련은 음성 분리 모델의 총 훈련 시간을 어느 정도 줄일 수 있는가?
  • RQ4훈련 시간을 단축시켰을 때, 사전 훈련은 모델 성능을 유지하거나 향상시키는가?

주요 결과

  • 특히 음성 향상 기반 과제를 사용한 자기지도 학습 사전 훈련은 음성 분리에서 레이블 순열 불안정성을 크게 감소시킨다.
  • 사전 훈련된 모델을 사용할 경우 훈련 기간이 원래의 1/3에서 2/3 수준으로 줄어든다.
  • 사전 훈련 시간을 포함해도 더 큰 배치 크기를 사용할 경우 기준 훈련보다 총 훈련 과정이 짧아진다.
  • 사전 훈련된 모델과 더 큰 배치 크기를 사용할 경우 성능이 저하되지 않고 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.