[논문 리뷰] End-to-end ASR: from Supervised to Semi-Supervised Learning with Modern Architectures
본 논문은 ResNet, Time-Depth Separable ConvNets, Transformer 음향 모델에 걸쳐 pseudo-labeling 기반의 준지도 학습을 엔드투엔드 ASR에 적용하여, 비라벨 LibriVox 데이터로 새로운 최첨단 성과를 달성하고, 풍부한 비라벨 오디오가 있을 때 외부 언어 모델에 대한 의존도를 감소시킴을 보인다.
We study pseudo-labeling for the semi-supervised training of ResNet, Time-Depth Separable ConvNets, and Transformers for speech recognition, with either CTC or Seq2Seq loss functions. We perform experiments on the standard LibriSpeech dataset, and leverage additional unlabeled data from LibriVox through pseudo-labeling. We show that while Transformer-based acoustic models have superior performance with the supervised dataset alone, semi-supervision improves all models across architectures and loss functions and bridges much of the performance gaps between them. In doing so, we reach a new state-of-the-art for end-to-end acoustic models decoded with an external language model in the standard supervised learning setting, and a new absolute state-of-the-art with semi-supervised training. Finally, we study the effect of leveraging different amounts of unlabeled audio, propose several ways of evaluating the characteristics of unlabeled audio which improve acoustic modeling, and show that acoustic models trained with more audio rely less on external language models.
연구 동기 및 목표
- 다양한 아키텍처에서 CTC 및 Seq2Seq 손실을 사용하여 엔드투엔드 ASR 성능을 동기 부여하고 평가한다.
- 비라벨 데이터가 사용 가능할 때 pseudo-label링을 통한 준지도 학습이 모델 성능에 미치는 영향을 평가한다.
- 디코딩 시 비라벨 오디오가 외부 언어 모델 의존도에 미치는 영향을 특성화한다.
- 외부 언어 모델의 여부에 관계없이 LibriSpeech에서 최첨단 엔드투엔드 결과를 보여준다.
- 다양한 아키텍처가 준지도 데이터로부터 어떻게 이점을 얻는지에 대한 통찰을 제공한다.
제안 방법
- CTC 또는 Seq2Seq 손실을 사용하여 다수의 엔드투엔드 음향 모델(ResNet, Time-Depth Separable ConvNets, Transformer)을 훈련한다.
- LibriSpeech를 라벨링 데이터로, LibriVox를 비라벨 데이터로 사용하고, Transformer AM으로 의사레이블을 생성하고 언어 모델로 디코딩한다.
- LibriSpeech 텍스트에서 n-gram, GCNN, Transformer 기반의 언어 모델을 구성하고 학습하되 비라벨 오디오와의 중복을 피하기 위해 신중한 데이터 필터링을 수행한다.
- 외부 LMs와 선택적 재점검을 통한 한 패스 빔 서치 디코딩을 수행하여 최종 전사를 얻는다.
- LibriSpeech dev/test 세트에서 디코딩/LM 여부 및 의사레이블 데이터 여부에 따른 WER을 보고하여 평가한다.
실험 결과
연구 질문
- RQ1대규모 비라벨 데이터에서의 pseudo-label링이 ASR에서 다양한 엔드투엔드 아키텍처(ResNet, TDS, Transformer)와 손실(CTC, Seq2Seq) 간의 성능 격차를 줄일 수 있는가?
- RQ2비라벨 데이터(LibriVox)의 증가가 아키텍처 전반의 WER과 외부 언어 모델 의존도에 어떻게 영향을 미치는가?
- RQ3엔드투엔드 ASR의 준지도 설정에서 디코딩과 LM 재스코어링의 상대적 기여도는 무엇인가?
- RQ4준지도 데이터로 학습된 엔드투엔드 모델이 외부 LMs 없이 LibriSpeech에서 최첨단 결과를 달성할 수 있으며, LMs를 사용할 때와의 비교는 어떠한가?
- RQ5레이블링에 사용된 언어 모델이 비라벨 코퍼스와 중복되는지에 따라 pseudo-labeling의 효과는 어떻게 달라지는가?
주요 결과
- 준지도 의사레이블링은 CTC 및 Seq2Seq 손실 전반에서 모든 아키텍처(ResNet, TDS, Transformer)의 성능을 향상시킨다.
- LibriVox 비라벨 데이터를 사용하면 Transformer 모델은 test-clean에서 2.28%, test-other에서 4.88%의 WER에 도달하되 디코딩 또는 LM 없이; LM으로 디코딩하면 각각 2.09%, 4.11%로 감소한다.
- LibriSpeech만으로 학습하고 디코딩 및 재스코어링을 적용한 엔드투엔드 Transformer 모델은 test-other에서 5.17%의 WER를 달성하고, 디코딩 없이 6.98%.
- LibriVox 의사레이블로 학습된 모델은 디코딩 중 외부 LMs 의존도가 감소하며, 비라벨 데이터가 풍부할수록 LM 재스코어링으로의 이득이 작아진다.
- LibriVox 의사레이블만으로 학습한 경우도 경쟁력 있는 결과를 내며, 예를 들어 LibriVox 라벨로만 학습된 Transformer AM의 dev-clean 2.38%, dev-other 5.43%( LibriSpeech 기준선 2.99% / 7.31% 대비).
- 의사레이블 오디오의 양을 늘리면 WER이 꾸준히 개선되며, 전체 LibriVox 보강 설정이 가장 우수한 결과를 보고한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.