Skip to main content
QUICK REVIEW

[논문 리뷰] Hybrid CTC-Attention based End-to-End Speech Recognition using Subword Units

Zhangyu Xiao, Zhijian Ou|arXiv (Cornell University)|2018. 07. 13.
Speech Recognition and Synthesis참고 문헌 21인용 수 4
한 줄 요약

이 논문은 서브워드 유닛을 사용한 하이브리드 CTC-Attention 엔드 투 엔드 음성 인식 시스템을 제안하며, 사전이나 외부 언어 모델 없이 LibriSpeech의 test_clean 셋에서 6.8% WER을 달성한다. 이 방법은 서브워드를 활용해 OOV 문제를 완화하고 더 긴 맥락을 효과적으로 모델링함으로써 문자 기반 시스템보다 WER을 12.8% 상대적으로 감소시킨다.

ABSTRACT

In this paper, we present an end-to-end automatic speech recognition system, which successfully employs subword units in a hybrid CTC-Attention based system. The subword units are obtained by the byte-pair encoding (BPE) compression algorithm. Compared to using words as modeling units, using characters or subword units does not suffer from the out-of-vocabulary (OOV) problem. Furthermore, using subword units further offers a capability in modeling longer context than using characters. We evaluate different systems over the LibriSpeech 1000h dataset. The subword-based hybrid CTC-Attention system obtains 6.8% word error rate (WER) on the test_clean subset without any dictionary or external language model. This represents a significant improvement (a 12.8% WER relative reduction) over the character-based hybrid CTC-Attention system.

연구 동기 및 목표

  • 문자 기반 엔드 투 엔드 ASR의 한계, 즉 장거리 의존성 모델링 부족과 높은 데이터 희소성 문제를 해결하기 위해.
  • 단어나 음소 기반 시스템에서 내재된 OOV 문제를 서브워드 유닛을 사용함으로써 해결하기 위해.
  • 서브워드 유닛을 사용한 하이브리드 아키텍처에서 CTC와 어텐션 손실을 조합하는 효과를 탐색하기 위해.
  • 서브워드 유닛 크기와 학습 데이터 규모가 시스템 성능에 미치는 영향을 평가하기 위해.

제안 방법

  • 서브워드 유닛은 전체 학습 전사 코퍼스에 대해 바이트-페어 인코딩(BPE) 알고리즘을 사용하여 생성된다.
  • 하이브리드 CTC-Attention 신경망 아키텍처가 사용되며, 단조적 정렬을 위한 CTC 손실과 맥락 인식 기반 생성을 위한 어텐션 기반 디코더 손실이 결합된다.
  • 모델은 배치 정규화를 적용한 8층 양방향 LSTM 인코더와 위치 기반 어텐션을 갖춘 단방향 LSTM 디코더를 사용한다.
  • 학습은 기울기 클리핑과 CTC 및 어텐션 손실의 가중 조합을 사용한 Adadelta로 최적화되며, 하이퍼파라미터 λ는 0.2로 조정된다.
  • 추론 시에는 비트 사이즈 20의 빔 서치를 사용하고, 4개의 Tesla K80 GPU를 사용해 1000시간 분량의 LibriSpeech 데이터로 시스템을 학습시킨다.
  • 서브워드 유닛 어휘 크기는 500으로 설정되었으며, 시스템은 외부 언어 모델이나 어휘 사전 없이 평가되었다.

실험 결과

연구 질문

  • RQ1서브워드 유닛은 문자 수준 모델링과 비교해 하이브리드 CTC-Attention 아키텍처에서 엔드 투 엔드 음성 인식 성능을 향상시킬 수 있는가?
  • RQ2서브워드 유닛의 사용은 엔드 투 엔드 ASR에서 OOV 문제와 장거리 맥락 모델링에 어떤 영향을 미치는가?
  • RQ3외부 언어 모델 없이 LibriSpeech에서 낮은 WER을 달성하기 위해 최적의 서브워드 유닛 수는 얼마인가?
  • RQ4학습 데이터 크기는 서브워드 기반 엔드 투 엔드 ASR 시스템의 성능에 어떤 영향을 미치는가?

주요 결과

  • 서브워드 기반 하이브리드 CTC-Attention 시스템은 사전이나 외부 언어 모델 없이도 LibriSpeech test_clean 셋에서 6.8% WER을 달성한다.
  • 이는 문자 기반 하이브리드 시스템 대비 12.8% 상대적 감소를 나타내며, 성능 향상이 뚜렷하다.
  • 1000개의 서브워드 유닛을 사용할 경우 문자 기반 모델보다 略적으로 더 좋은 성능을 내지만, 더 큰 서브워드 어휘 크기(예: 1000 단위)에서는 데이터 희소성으로 인해 성능이 떨어진다.
  • 100시간 분량의 데이터로 학습한 모델은 test_clean에서 34.7% WER을 기록했고, 500시간 분량일 경우 10.4%, 1000시간 분량일 경우 6.8%로 성능이 향상되어 데이터 스케일링의 강력한 이점을 보여준다.
  • 하이브리드 손실의 최적 λ 값은 0.2이며, λ를 0.5로 증가시키면 CTC가 언어 모델 없이도 성능이 열 劣하므로 성능이 악화된다.
  • 서브워드 유닛은 오픈 어휘 인식을 가능하게 하고 희귀어나 복합어의 모델링을 향상시켜, 단어 수준 유닛 대비 OOV 문제를 줄여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.