[논문 리뷰] Large-Scale Self- and Semi-Supervised Learning for Speech Translation
이 논문은 추가적인 감독 없이 CoVoST 2 데이터만을 사용하여 단순하면서도 효과적인 음성 번역(ST) 접근법을 제안한다. 이는 wav2vec 2.0의 자기지도 학습 전훈, 대규모 비라벨링된 Libri-Light 음성 데이터에 대한 단일 라운드의 자기학습, 그리고 언어 모델 디코딩을 조합한 것이다. 이 방법은 네 개의 언어 쌍에 걸쳐 평균 BLEU 점수 25.6을 달성하여 이전 최고 성능보다 2.6 BLEU 향상되었으며, ST 데이터 이외의 추가 감독 정보를 사용하지 않았다.
In this paper, we improve speech translation (ST) through effectively leveraging large quantities of unlabeled speech and text data in different and complementary ways. We explore both pretraining and self-training by using the large Libri-Light speech audio corpus and language modeling with CommonCrawl. Our experiments improve over the previous state of the art by 2.6 BLEU on average on all four considered CoVoST 2 language pairs via a simple recipe of combining wav2vec 2.0 pretraining, a single iteration of self-training and decoding with a language model. Different to existing work, our approach does not leverage any other supervision than ST data. Code and models will be publicly released.
연구 동기 및 목표
- 추가적인 레이블링된 ASR 또는 기계 번역 데이터에 의존하지 않고, 비라벨링된 음성 및 텍스트 데이터만을 사용하여 음성 번역 성능을 향상시키는 것.
- 비지도 전훈, 자기학습, 언어 모델링의 효과성과 상호보완성에 대해 음성 번역 맥락에서 탐구하는 것.
- ST 데이터에만 의존하는 강력하고 단순한 기준 성능을 확립하여 이전 방법보다 더 적은 감독 정보로도 성능을 뛰어넘는 것.
제안 방법
- 53,000시간의 비라벨링된 Libri-Light 음성 데이터를 대상으로 wav2vec 2.0 모델을 전훈하여 강력한 음성 표현을 학습한다.
- CoVoST 2 ST 데이터를 사용해 전훈된 인코더를 무작위로 초기화된 Transformer 디코더로 미세조정하여 교사 모델을 구성한다.
- 교사 모델을 사용해 60,000시간의 비라벨링된 Libri-Light 음성 데이터에 대해 편집된 라벨(가짜 라벨)을 생성하고, 자기학습을 위한 합성 훈련 데이터를 만든다.
- 실제 CoVoST 2 데이터와 편집된 Libri-Light 데이터를 조합하여 학습하는 학생 모델을 훈련하며, 중요도를 균형 잡기 위해 데이터를 업샘플링한다.
- 단일 언어의 CommonCrawl 데이터를 기반으로 목표 언어의 언어 모델을 훈련하고, 비트 시퀀스 검색 디코딩 중 얕은 융합을 적용하여 생성 품질을 향상시킨다.
- 전훈, 자기학습, 언어 모델링을 모두 통합하여 유일한 파이프라인으로 조합하여 성능을 최대화한다.
실험 결과
연구 질문
- RQ1추가 감독 없이 자기지도 전훈과 자기학습을 효과적으로 조합하여 음성 번역 성능을 향상시킬 수 있는가?
- RQ2비라벨링된 음성 및 텍스트 데이터의 규모가 음성 번역 모델 성능에 어떤 영향을 미치는가?
- RQ3저자원 ST 환경에서 자기학습과 전훈을 함께 사용할 때 언어 모델 디코딩이 번역 품질을 향상시키는가?
- RQ4전훈과 자기학습을 조합했을 때 성능 향상이 여러 언어 쌍에 걸쳐 일관되게 유지되는가?
- RQ5어댑터나 LNA 미세조정 없이 단순화된 모델 아키텍처가 더 복잡한 이전 모델을 능가할 수 있는가?
주요 결과
- 제안된 방법은 네 개의 언어 쌍에 걸쳐 CoVoST 2 벤치마크에서 평균 BLEU 점수 25.6을 달성하여 새로운 SOTA 성능을 확립하였으며, 이는 이전 SOTA보다 2.6 BLEU 향상된 결과이다.
- 60,000시간의 Libri-Light 데이터에 대한 자기학습은 wav2vec 2.0 전훈만으로 한 경우보다 2.3 BLEU 향상되었으며, 전훈과 자기학습 간 강력한 상호보완성이 입증되었다.
- 언어 모델 디코딩은 전훈 전용 기준보다 1.1 BLEU 향상되었고, 전훈 + 자기학습 설정보다는 1.0 BLEU 향상되었다.
- 비라벨링된 음성 데이터의 전훈 규모를 60,000시간에서 960시간으로 늘릴 경우 평균 3.0 BLEU 향상이 발생하였으며, 데이터 규모의 이점이 확인되었다.
- 자기학습 데이터를 960시간에서 60,000시간으로 확장했을 때 각각 0.6 BLEU와 0.5 BLEU의 점진적 향상이 있었으며, 더 많은 데이터로도 계속 이점이 있음을 보여주었다.
- mBART와 추가 MT 데이터를 사용한 이전 작업보다 성능이 뛰어나, ST 데이터만으로도 추가 감독 없이도 성능 향상을 달성할 수 있음을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.