[논문 리뷰] Continual-wav2vec2: an Application of Continual Learning for Self-Supervised Automatic Speech Recognition.
이 논문은 기존 언어를 잊지 않고 새로운 언어를 학습할 수 있도록 하는 지속적 학습 프레임워크인 Continual-Wav2Vec2를 제안한다. 이는 이전 작업에서의 지식을 전이함으로써 사전 훈련 시간을 32% 감소시키면서도 여러 언어에서 성능을 유지한다.
We present a method for continual learning of speech representations for multiple languages using self-supervised learning (SSL) and applying these for automatic speech recognition. There is an abundance of unannotated speech, so creating self-supervised representations from raw audio and finetuning on a small annotated datasets is a promising direction to build speech recognition systems. Wav2vec models perform SSL on raw audio in a pretraining phase and then finetune on a small fraction of annotated data. SSL models have produced state of the art results for ASR. However, these models are very expensive to pretrain with self-supervision. We tackle the problem of learning new language representations continually from audio without forgetting a previous language representation. We use ideas from continual learning to transfer knowledge from a previous task to speed up pretraining a new language task. Our continual-wav2vec2 model can decrease pretraining times by 32% when learning a new language task, and learn this new audio-language representation without forgetting previous language representation.
연구 동기 및 목표
- 새로운 언어를 추가할 때 자기지도 학습 음성 모델의 사전 훈련 비용 문제를 해결하기 위해.
- 이전에 학습한 언어를 잊지 않고 새로운 언어 표현을 지속적으로 학습할 수 있도록 하기 위해.
- 이전 작업에서의 지식을 활용하여 새로운 언어 표현의 사전 훈련에 필요한 계산 비용을 줄이기 위해.
- 지속적 학습 기간 동안 여러 언어에서 고성능의 자동 음성 인식(ASR) 성능을 유지하기 위해.
제안 방법
- Wav2Vec2의 자기지도 사전 훈련 단계에 지속적 학습 기법을 적용하여 음성 표현 학습에 활용하기 위해.
- 이전에 학습한 언어 표현에서의 지식을 전이하여 새로운 언어의 사전 훈련을 가속화하기 위해.
- 이전 언어의 성능을 유지하기 위해 리플레이 기반 또는 지식 정렬 전략을 사용하기 위해.
- 지속적 사전 훈련 후 소량의 애너테이션 데이터로 모델을 미세 조정하여 최종 ASR 작업에 적합하게 만들기 위해.
- 원시 오디오에 대해 대비 학습 목표를 적용하여 다국어 간의 통합 음성 표현을 학습하기 위해.
- 정규화 또는 경험 재현을 통해 새로운 언어에 대한 파라미터 업데이트가 이전에 학습한 언어의 성능을 떨어뜨리지 않도록 보장하기 위해.
실험 결과
연구 질문
- RQ1지속적 학습 기법이 자기지도 사전 훈련 단계의 음성 표현에 효과적으로 적용될 수 있는가?
- RQ2이전 언어에서의 지식 전이가 새로운 언어의 사전 훈련 시간을 얼마나 줄일 수 있는가?
- RQ3지속적 학습이 자기지도 모델에서 이전에 학습한 언어 표현의 치명적인 잊힘을 방지하는가?
- RQ4지속적 학습 방법이 표준 사전 훈련 대비 최종 ASR 정확도 측면에서 어떻게 성능을 냅니다?
주요 결과
- Continual-Wav2Vec2는 표준 사전 훈련 대비 새로운 언어를 학습할 때 사전 훈련 시간을 32% 감소시킨다.
- 모델은 치명적인 잊힘 없이 이전에 학습한 언어에서 높은 성능을 유지한다.
- 지속적 학습 방식을 통해 추가 계산 비용을 최소화하면서도 새로운 언어에 효율적으로 적응할 수 있다.
- 지속적 학습 이후 여러 언어에서 최신 기술 수준의 ASR 성능을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.