Skip to main content
QUICK REVIEW

[논문 리뷰] Supervised Contrastive Learning for Accented Speech Recognition

Tao Han, Hantao Huang|arXiv (Cornell University)|2021. 07. 02.
Speech Recognition and Synthesis참고 문헌 19인용 수 9
한 줄 요약

이 논문은 음성 인식에서 비표준 발음에 대한 저항성을 높이기 위해 발음에 영향을 받지 않는 표현을 학습하는 감독형 대비 학습 프레임워크를 제안한다. 같은 언어적 목표에 대해 다양한 양식의 양성 시각(positive views)을 생성하기 위해 노이즈 주입, 스펙트로그램 증강, TTS-같은문장 생성과 같은 데이터 증강 기법을 적용함으로써, 공동 학습 대비 단어 오류률(WER)을 제로샷 설정에서 3.66%, 풀샷 설정에서 3.78% 감소시켜, 낯선 발음에 대한 강건성을 향상시킴을 보여준다.

ABSTRACT

Neural network based speech recognition systems suffer from performance degradation due to accented speech, especially unfamiliar accents. In this paper, we study the supervised contrastive learning framework for accented speech recognition. To build different views (similar "positive" data samples) for contrastive learning, three data augmentation techniques including noise injection, spectrogram augmentation and TTS-same-sentence generation are further investigated. From the experiments on the Common Voice dataset, we have shown that contrastive learning helps to build data-augmentation invariant and pronunciation invariant representations, which significantly outperforms traditional joint training methods in both zero-shot and full-shot settings. Experiments show that contrastive learning can improve accuracy by 3.66% (zero-shot) and 3.78% (full-shot) on average, comparing to the joint training method.

연구 동기 및 목표

  • 이상하거나 알려지지 않은 발음에 대해 신경망 기반 ASR 시스템의 성능 저하 문제를 해결하기 위해.
  • 아키텍처 변경 없이 감독형 대비 학습이 발음 다양성에 대한 강건성을 향상시킬 수 있는지 탐구하기 위해.
  • 음성 분야의 대비 학습에서 정보적인 양성 시각을 생성하는 데에 효과적인 데이터 증강 기법의 효능을 조사하기 위해.
  • 대비 학습이 종단간 엔드 투 엔드 ASR에서 발음 방식과 데이터 증강에 영향을 받지 않는 표현을 학습할 수 있는지 보여주기 위해.
  • 일반화 능력과 적응 능력을 평가하기 위해 제로샷 및 풀샷 설정 모두에서 방법을 평가하기 위해.

제안 방법

  • 동일한 음소나 문자에 대해 서로 다른 발음에서의 임베딩 간의 유사도를 높이고, 다른 클래스의 임베딩 간의 유사도를 낮추도록 하는 감독형 대비 학습 손실을 적용한다.
  • 노이즈 주입, 스펙트로그램 증강, TTS-같은문장 생성의 세 가지 데이터 증강 기법을 사용하여 동일한 언어적 목표에 대해 다양한 양성 시각을 생성한다.
  • 동일한 레이블에 속하는 증강된 시각 간의 유사도를 극대화하고, 다른 레이블 간의 유사도를 최소화하도록 대비 손실 함수를 사용해 모델을 훈련한다.
  • 네트워크 아키텍처를 수정하지 않고 표준 종단간 엔드 투 엔드 ASR 모델(예: 컨포머 기반)에 대비 손실을 통합한다.
  • 레이블 정보를 활용해 양성 쌍(다른 발음에서 동일한 음소)을 정의하고, 비감독 대비 학습에서 흔히 발생하는 오분류(거짓 음성)를 방지한다.
  • 숨은 표현의 t-SNE 시각화를 수행하여, 동일한 음소이지만 다른 발음에서 온 샘플들이 함께 군집되는지의 여부를 정성적으로 검증한다.

실험 결과

연구 질문

  • RQ1감독형 대비 학습은 아키텍처 수정 없이 비표준 발음 음성 인식의 강건성을 향상시킬 수 있는가?
  • RQ2노이즈, 스펙트로그램, TTS 등의 다양한 데이터 증강 기법이 ASR 분야의 대비 학습에서 유용한 양성 시각을 생성하는 데 얼마나 효과적인가?
  • RQ3대비 학습은 공동 학습 대비 발음에 영향을 받지 않는 표현과 데이터 증강에 영향을 받지 않는 표현을 학습하는 데 더 효과적인가?
  • RQ4제로샷 및 풀샷 설정에서 대비 학습이 공동 학습 대비 비표준 발음에서의 상대적 성능 향상은 어느 정도인가?
  • RQ5제안된 방법은 잡음이나 반향과 같은 다른 강건성 문제에 일반화될 수 있는가?

주요 결과

  • 감독형 대비 학습은 제로샷 설정에서 평균적으로 공동 학습 대비 WER을 3.66% 감소시키고, 풀샷 설정에서는 3.78% 감소시킨다.
  • 스펙트로그램 증강이 가장 높은 성능 향상을 보였으며, 제로샷 설정에서 WER을 7.39% 절대 감소시키고, 풀샷 설정에서는 7.63% 감소시켰다.
  • TTS-같은문장 생성은 제로샷 설정에서는 제한적인 이점(0.13% WER 감소)을 보였지만, 풀샷 설정에서는 WER을 2.93% 향상시켜 더 많은 데이터에서의 이점이 있음을 시사한다.
  • t-SNE 시각화 결과, 대비 학습이 서로 다른 발음에서 온 동일한 음소 샘플들을 함께 군집시키며, 발음에 영향을 받지 않는 표현 학습이 이루어졌음을 확인했다.
  • 데이터 증강 없이도 대비 손실 자체만으로도 공동 학습 대비 WER이 제로샷 설정에서 1.35% 향상되고, 풀샷 설정에서는 0.7% 향상되어 손실의 내재적 이점이 있음을 보여준다.
  • 모든 데이터 증강 기법을 대비 학습과 결합할 경우, 공동 학습 대비 WER 감소 폭이 가장 크게 나타났다: 제로샷 설정에서 7.99%, 풀샷 설정에서 8.94% 감소하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.