[논문 리뷰] Learning to Recognize Code-switched Speech Without Forgetting Monolingual Speech Recognition
이 논문은 기존 단어별 언어 학습 데이터가 없는 상황에서도 코드 스위칭 음성에 대해 종단간 음성 인식 모델을 훈련하기 위해 학습 과정에서 잊히지 않는(Learning Without Forgetting, LWF) 프레임워크를 사용하는 것을 제안한다. 코드 스위칭 데이터로의 피니어튜닝 중 원래의 단어별 언어 분포를 유지함으로써, 표준 피니어튜닝 및 통합 데이터 접근 방식과 비교해도 단어 오류율(Word Error Rate, WER)이 단어별 언어 및 코드 스위칭 테스트 세트에서 모두 낮아지며, 원래의 단어별 언어 훈련 데이터에 접근할 수 없음에도 불구하고 성능 저하 없이 기록을 달성한다.
Recently, there has been significant progress made in Automatic Speech Recognition (ASR) of code-switched speech, leading to gains in accuracy on code-switched datasets in many language pairs. Code-switched speech co-occurs with monolingual speech in one or both languages being mixed. In this work, we show that fine-tuning ASR models on code-switched speech harms performance on monolingual speech. We point out the need to optimize models for code-switching while also ensuring that monolingual performance is not sacrificed. Monolingual models may be trained on thousands of hours of speech which may not be available for re-training a new model. We propose using the Learning Without Forgetting (LWF) framework for code-switched ASR when we only have access to a monolingual model and do not have the data it was trained on. We show that it is possible to train models using this framework that perform well on both code-switched and monolingual test sets. In cases where we have access to monolingual training data as well, we propose regularization strategies for fine-tuning models for code-switching without sacrificing monolingual accuracy. We report improvements in Word Error Rate (WER) in monolingual and code-switched test sets compared to baselines that use pooled data and simple fine-tuning.
연구 동기 및 목표
- 코드 스위칭 음성 인식에서 치명적인 잊힘(catastrophic forgetting) 문제를 해결하기 위해, 코드 스위칭 데이터로의 피니어튜닝이 단어별 언어 ASR 성능에 악영향을 미치는 것을 방지하기 위함.
- 단어별 언어 훈련 데이터가 이용 불가능한 상황에서도 코드 스위칭 ASR 정확도를 향상시키면서도 단어별 언어 인식 성능를 유지하는 방법을 개발하기 위함.
- 제한된 코드 스위칭 데이터로도 단어별 언어 및 코드 스위칭 음성에서 모두 높은 정확도를 유지할 수 있도록 정규화 및 피니어튜닝 전략을 제안하기 위함.
- LWF 프레임워크가 원래의 단어별 언어 훈련 데이터에 접근할 필요 없이도 코드 스위칭에 대한 효과적인 도메인 적응을 가능하게 함을 입증하기 위함.
- 모델의 일반화 능력을 보장하기 위해 코드 스위칭 ASR 연구에서 단어별 언어 성능 보고를 권장하기 위함.
제안 방법
- 원래의 단어별 언어 훈련 데이터에 접근할 수 없음에도 불구하고, 사전에 훈련된 단어별 언어 ASR 모델을 코드 스위칭 음성으로 피니어튜닝하기 위해 학습 과정에서 잊히지 않는(LWF) 프레임워크를 채택한다.
- 이중 단계 훈련 과정을 사용한다: 첫 번째 단계에서는 공유 및 단어별 언어 전용 레이어를 고정하고, 새로운 코드 스위칭 작업 전용 헤드만 훈련한다(워밍업 단계).
- 두 번째 단계에서는 공유 및 단어별 언어 구성 요소를 포함한 모든 레이어를 함께 피니어튜닝하면서, 원래 모델의 지식을 디스틸리이션 손실을 통해 유지한다.
- 피니어튜닝 단계 동안, 새로운 모델이 원래의 단어별 언어 모델의 출력 확률을 모방하도록 지식 디스틸리이션을 적용한다.
- 단어별 언어 데이터에 접근 가능한 경우, 단어별 언어 및 코드 스위칭 성능를 동시에 최적화하기 위한 정규화 및 피니어튜닝 전략을 적용한다.
- 공유 인코더 레이어와 작업 전용 헤드를 갖춘 CTC 기반 종단간 모델을 사용하며, 단어별 언어(θₘ) 및 코드 스위칭(θ_c) 작업에 각각 전용한다.
실험 결과
연구 질문
- RQ1코드 스위칭 데이터로 단어별 언어 ASR 모델을 피니어튜닝하면, 치명적인 잊힘으로 인해 단어별 언어 테스트 세트에서 성능 저하가 발생하는가?
- RQ2LWF 프레임워크는 코드 스위칭 음성 인식 정확도를 향상시키는 동시에 단어별 언어 성능를 효과적으로 유지할 수 있는가?
- RQ3표준 피니어튜닝 및 통합 데이터 훈련 방식과 비교해 LWF 기반 접근 방식은 단어별 언어 및 코드 스위칭 테스트 세트에서 WER 측면에서 어떻게 성능을 내는가?
- RQ4원래의 단어별 언어 훈련 데이터에 접근할 수 없을 경우, LWF 방법이 사전에 훈련된 단어별 언어 모델만으로도 효과적으로 작동할 수 있는가?
- RQ5정규화 및 피니어튜닝 전략의 영향은 단어별 언어 및 코드 스위칭 음성 인식의 통합 성능에 어떻게 작용하는가?
주요 결과
- LWF 모델은 타밀어 단어별 언어 테스트 세트에서 48.90 WER 기록을 달성했으며, 단어별 언어 기준 모델(50.09 WER)과 피니어튜닝 모델(50.03 WER)을 모두 초월했다.
- 테루구-영어 코드 스위칭 데이터에서 LWF 모델은 43.60 WER를 기록했으며, 동일한 테스트 세트에서 가장 우수한 피니어튜닝 모델(39.32 WER)보다도 높은 성능를 보였다.
- LWF 모델은 피니어튜닝 모델에서 관찰된 단어별 언어 성능 저하를 줄였으며, 尤히 구자라트어에서 두드러졌다. 피니어튜닝 모델의 WER는 41.99에서 46.42로 상승했지만, LWF는 42.30 WER를 유지했다.
- 원래의 단어별 언어 데이터에 접근할 필요 없이도 LWF 모델은 모든 테스트 세트에서 통합 모델보다 뛰어난 성능를 보였으며, 이는 원래의 단어별 언어 데이터가 필요 없음에도 효과적인 것을 입증한다.
- LWF 프레임워크는 치명적인 잊힘을 완화시켜, 단어별 언어 및 코드 스위칭 음성 인식을 동시에 최적화할 수 있도록 하며 성능 트레이드오프 없이 기능한다.
- 본 연구는 표준적인 코드 스위칭 데이터로의 피니어튜닝이 단어별 언어 성능에 악영향을 미친다는 점을 입증하며, 다국어 ASR에서 지속적 학습 기법의 필요성을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.