Skip to main content
QUICK REVIEW

[논문 리뷰] Silence is Sweeter Than Speech: Self-Supervised Model Using Silence to Store Speaker Information

Chi-Luen Feng, Po‐Chun Hsu|arXiv (Cornell University)|2022. 05. 08.
Speech Recognition and Synthesis인용 수 6
한 줄 요약

이 논문은 HuBERT와 같은 자기지도 학습 음성 모델이 음성 웨이브포맷의 침묵 세그먼트에 해당하는 표현에 주로 발화자 정보를 저장한다는 것을 드러낸다. 훈련 데이터에 침묵을 삽입함으로써 모델의 발화자 식별 정확도가 피팅 튜닝 없이 약 2% 향상되며, 이는 침묵이 학습된 표현에서 발화자 특성의 분리(disentanglement)를 향상시킨다는 것을 보여준다.

ABSTRACT

Self-Supervised Learning (SSL) has made great strides recently. SSL speech models achieve decent performance on a wide range of downstream tasks, suggesting that they extract different aspects of information from speech. However, how SSL models store various information in hidden representations without interfering is still poorly understood. Taking the recently successful SSL model, HuBERT, as an example, we explore how the SSL model processes and stores speaker information in the representation. We found that HuBERT stores speaker information in representations whose positions correspond to silences in a waveform. There are several pieces of evidence. (1) We find that the utterances with more silent parts in the waveforms have better Speaker Identification (SID) accuracy. (2) If we use the whole utterances for SID, the silence part always contributes more to the SID task. (3) If we only use the representation of a part of the utterance for SID, the silenced part has higher accuracy than the other parts. Our findings not only contribute to a better understanding of SSL models but also improve performance. By simply adding silence to the original waveform, HuBERT improved its accuracy on SID by nearly 2%.

연구 동기 및 목표

  • 자기지도 학습(SSL) 모델인 HuBERT가 그들의 은닉 표현에 발화자 정보를 어떻게 저장하는지 조사하기.
  • 음성 웨이브포맷에서 침묵의 위치가 발화자 특수 정보 저장과 관련이 있는지 조사하기.
  • 훈련 데이터에 침묵을 추가함으로써 최종 발화자 식별(SID) 성능을 향상시킬 수 있는지 확인하기.
  • 다양한 유형의 음성 정보(예: 발화자, 내용)가 웨이브포맷 내에서 서로 다른 시간적 위치에 저장되는지 탐색하기.

제안 방법

  • HuBERT 표현 내 발화자 정보를 측정하기 위해 발화자 식별(SID)을 탐색 작업으로 사용하였다.
  • 발화를 조각들로 나누고 개별 조각의 표현을 사용하여 SID 정확도를 평가함으로써 어떤 부분이 발화자 정보를 저장하는지 확인하였다.
  • 웨이브포맷의 시작이나 끝에 침묵을 삽입하고 침묵 세그먼트와 음성 세그먼트 간의 SID 성능을 비교하였다.
  • 하류 분류기(선형)를 HuBERT의 가중치가 부여된 레이어 표현에 대해 훈련하여 다양한 데이터 구성에서의 SID 성능을 평가하였다.
  • 성능 향상을 위한 최적의 삽입 길이를 찾기 위해 침묵 길이를 체계적으로 변화시켰다(원래 발화의 1/50, 1/10, 1/5).
  • 웨이브포맷 조각을 무작위로 섞음으로써 침묵 기반 표현 학습의 강건성을 테스트하기 위해 분석을 수행하였다.

실험 결과

연구 질문

  • RQ1음성 웨이브포맷에 침묵이 존재할 경우, HuBERT 표현 내 발화자 정보 저장 비율이 높아지는가?
  • RQ2침묵 세그먼트의 표현이 음성 세그먼트의 표현보다 발화자 식별 작업에서 더 높은 성능을 내는가?
  • RQ3훈련 데이터에 침묵을 삽입함으로써 상游 SSL 모델을 피팅 튜닝 없이 발화자 식별 성능을 향상시킬 수 있는가?
  • RQ4발화자 식별 정확도를 최대화하는 데 가장 적합한 삽입 침묵 길이는 무엇인가?

주요 결과

  • 침묵 비율이 높은 발화에서는 발화자 식별(SID) 정확도가 유의미하게 향상되었으며, 침묵 비율이 5% 이하로 떨어지면 성능이 30~50% 감소하였다.
  • 침묵 세그먼트는 항상 어떤 음성 세그먼트보다 SID 성능에 더 큰 기여를 하였으며, 단독으로 사용할 경우 모든 세그먼트 중 가장 높은 정확도를 기록하였다.
  • 웨이브포맷의 시작이나 끝에 침묵을 삽입함으로써 HuBERT base 모델의 SID 정확도가 약 2% 향상되었으며, HuBERT-large 모델의 경우 0.2% 향상되었다.
  • 최적의 침묵 길이는 원래 발화 길이의 1/10으로 확인되었으며, 이보다 짧거나 긴 삽입은 성능을 떨어뜨렸다.
  • 침묵 세그먼트는 주변 음성 세그먼트로부터 발화자 정보를 집계하는 것으로 나타나, 발화자 및 내용 표현의 분리에 기여하는 역할을 할 수 있다.
  • 연구 결과는 침묵이 자기지도 표현에서 발화자 특수 정보의 저장 및 검색 능력을 향상시키는 구조적 신호로 작용한다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.