Skip to main content
QUICK REVIEW

[논문 리뷰] CSTNet: Contrastive Speech Translation Network for Self-Supervised Speech Representation Learning

Sameer Khurana, Antoine Laurent|arXiv (Cornell University)|2020. 06. 04.
Natural Language Processing Techniques참고 문헌 36인용 수 9
한 줄 요약

CSTNet는 수동 레이블이 없는 음성에서 언어 표현을 학습하기 위해 쌍화된 음성-번역 데이터를 활용하는 자기지도 대비 학습 프레임워크를 제안한다. 대응하는 텍스트 번역을 대비 학습을 통해 검색하도록 컨볼루션 음성 인코더를 훈련시킴으로써 모델은 의미 있는 음소적 및 언어적 특징을 학습하게 되며, 음소 인식 작업에서 최신 기술 수준의 성능을 달성하여 이전 방법보다 최대 8个百分点 높은 ABX 오차율을 기록한다.

ABSTRACT

More than half of the 7,000 languages in the world are in imminent danger of going extinct. Traditional methods of documenting language proceed by collecting audio data followed by manual annotation by trained linguists at different levels of granularity. This time consuming and painstaking process could benefit from machine learning. Many endangered languages do not have any orthographic form but usually have speakers that are bi-lingual and trained in a high resource language. It is relatively easy to obtain textual translations corresponding to speech. In this work, we provide a multimodal machine learning framework for speech representation learning by exploiting the correlations between the two modalities namely speech and its corresponding text translation. Here, we construct a convolutional neural network audio encoder capable of extracting linguistic representations from speech. The audio encoder is trained to perform a speech-translation retrieval task in a contrastive learning framework. By evaluating the learned representations on a phone recognition task, we demonstrate that linguistic representations emerge in the audio encoder's internal representations as a by-product of learning to perform the retrieval task.

연구 동기 및 목표

  • 음성-텍스트 번역 데이터 쌍만을 사용하여 음성 표현 학습을 위한 자기지도 학습 프레임워크를 개발하는 것, 특히 체계가 없는 언어에 특히 적용 가능하다.
  • 음성-번역 검색 작업을 통해 훈련된 음성 인코더에서 언어 표현이 어떻게 유도되는지 조사하는 것.
  • 음성-번역 쌍에 대한 대비 학습이 최신 기술 수준의 모델과 비교하여 높은 품질의 저수준 언어 표현을 생성할 수 있음을 보여주는 것.

제안 방법

  • 원시 파형에서 음성 표현을 추출하기 위해 컨볼루션 신경망(CNN) 음성 인코더를 사용한다.
  • 모델은 대비 학습 프레임워크를 활용하며, 일치하는 음성-번역 쌍의 임베딩을 정렬하고 불일치하는 쌍을 분리하기 위해 트리플릿 손실을 최적화한다.
  • 음성-번역 검색 작업을 위해 음성 인코더와 텍스트 인코더를 함께 훈련시켜 공유 임베딩을 생성한다.
  • 프레임워크는 영어 음성과 프랑스어, 독일어, 스페인어, 포르투갈어, 이탈리아어 번역이 매칭된 MuST-C 데이터셋을 사용하여 훈련된다.
  • 음성 표현 품질을 평가하기 위해 음소 인식 및 ABX 작업과 같은 후행 작업에서 모델을 평가한다.
  • ABX 오차 및 음소 인식 성능 기반으로 최고 성능을 보인 모델을 선별하며, 음성 인코더의 최종 레이어에서 특징을 추출한다.

실험 결과

연구 질문

  • RQ1수동 레이블 없이 쌍화된 음성-번역 데이터만을 사용하여 자기지도 학습을 통해 음성 인코더에서 언어 표현이 유도될 수 있는가?
  • RQ2음성-번역 검색 작업을 수행하도록 훈련된 음성 인코더가 기존 자기지도 학습 방법보다 더 나은 음소 표현 학습을 이끌 수 있는가?
  • RQ3학습된 표현의 성능은 음소 인식 및 ABX 평가와 같은 후행 작업에서 최신 기술 수준의 모델과 비교하여 어떻게 되는가?

주요 결과

  • CSTNet 모델은 영어-프랑스어 쌍으로 훈련된 경우 ZRC19 영어 테스트 세트에서 ABX 오차율 29.2%를 기록하며, Wavenet-VQ 기준선보다 8个百分点 높은 성능을 보였다.
  • 음성 인코더의 최종 레이어에서 추출한 특징을 사용할 때 가장 뛰어난 음소 인식 성능을 기록했으며, 영어-프랑스어 모델을 사용해 WSJ eval92 세트에서 29.2%의 음소 오류율(PER)을 달성했다.
  • 영어-프랑스어 쌍으로 훈련된 모델이 모든 언어 쌍 중에서 가장 뛰어난 성능을 보였으며, WSJ 데이터셋에서 가장 높은 성능과 가장 낮은 성능 간의 PER 격차는 2.8个百分点였다(영어-독일어 대비).
  • 음성-시각 데이터로 훈련되지 않은 상태에서도 CSTNet 모델은 음소 인식 작업에서 ResDAVENet보다 6个百分点 높은 성능을 기록했다.
  • 모델의 네트워크 깊이가 증가할수록 음소 인식 성능이 일관되게 향상되었으며, 모든 언어 쌍에서 최종 레이어에서 가장 높은 성능을 기록했다.
  • 결과는 음성 인코더의 내부 표현에 언어 정보, 특히 음소적 내용이 효과적으로 인코딩되어 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.