Skip to main content
QUICK REVIEW

[논문 리뷰] A Multi-Task Learning Framework for Overcoming the Catastrophic Forgetting in Automatic Speech Recognition

Jiabin Xue, Jiqing Han|arXiv (Cornell University)|2019. 04. 17.
Speech Recognition and Synthesis참고 문헌 27인용 수 9
한 줄 요약

이 논문은 다중 작업 학습(MTL) 프레임워크인 MTLCF를 제안하여 엔드 투 엔드 음성 인식(ASR)에서 치명적인 잊음 현상을 완화한다. 이는 기존 지식을 동시에 유지하고 새로운 도메인 전용 지식을 학습함으로써 달성된다. 균형 잡힌 손실 가중치를 사용하여 지식 유지와 새로운 작업 적응이라는 두 가지 작업을 동시에 최적화함으로써, 기존(LibriSpeech) 및 대상(Switchboard) 데이터셋 모두에서 최신 기술 성능을 달성하였으며, 미세조정 대비 기존 데이터셋에서 5% 상대적 CER 감소를 기록하였다.

ABSTRACT

Recently, data-driven based Automatic Speech Recognition (ASR) systems have achieved state-of-the-art results. And transfer learning is often used when those existing systems are adapted to the target domain, e.g., fine-tuning, retraining. However, in the processes, the system parameters may well deviate too much from the previously learned parameters. Thus, it is difficult for the system training process to learn knowledge from target domains meanwhile not forgetting knowledge from the previous learning process, which is called as catastrophic forgetting (CF). In this paper, we attempt to solve the CF problem with the lifelong learning and propose a novel multi-task learning (MTL) training framework for ASR. It considers reserving original knowledge and learning new knowledge as two independent tasks, respectively. On the one hand, we constrain the new parameters not to deviate too far from the original parameters and punish the new system when forgetting original knowledge. On the other hand, we force the new system to solve new knowledge quickly. Then, a MTL mechanism is employed to get the balance between the two tasks. We applied our method to an End2End ASR task and obtained the best performance in both target and original datasets.

연구 동기 및 목표

  • 엔드 투 엔드 ASR 시스템에서 도메인 적응 중 치명적인 잊음 현상을 해결하기 위해.
  • 성능이 기존 도메인에서 악화되는 미세조정의 한계와 동시에 두 도메인을 최적화하지 못하는 재학습의 한계를 극복하기 위해.
  • 고정된 아키텍처를 사용하여 대규모 ASR 작업에 대해 확장 가능한 방식으로 수명 주기 학습 원칙을 적용하기 위해.
  • 지식 유지와 새로운 작업 학습을 균형 잡는 다중 작업 학습 메커니즘을 개발하기 위해.

제안 방법

  • 도메인 적응을 두 가지 독립적인 작업으로 설정: 기존 모델 지식 유지 및 새로운 도메인 전용 지식 학습.
  • 초파rameter α와 β를 사용하여 두 작업 간의 상호보완적 트레이드오프를 제어하는 균형 잡힌 MTL 목적 함수 도입.
  • 기존 가중치에서 파ram터 업데이트가 벗어나지 않도록 L2 정규화를 적용하여 학습된 지식을 유지.
  • 계산 효율성과 확장성을 유지하기 위해 고정된 신경망 아키텍처를 사용.
  • 작업별 손실을 균형 잡힌 가중치로 조합한 통합 손실 함수를 사용하여 모델 최적화.
  • 지식 유지(작업 1)와 새로운 작업 성능(작업 2) 간 상대적 중요도를 제어하기 위해 초파rameter α와 β를 튜닝.

실험 결과

연구 질문

  • RQ1다중 작업 학습 프레임워크가 엔드 투 엔드 ASR에서 도메인 적응 중 치명적인 잊음 현상을 효과적으로 줄일 수 있는가?
  • RQ2지식 유지와 새로운 작업 학습 간의 균형 조절이 기존 도메인과 대상 도메인 양쪽에서 성능에 어떤 영향을 미치는가?
  • RQ3초파rameter α와 β 측면에서 기존 지식 유지를 유지하고 새로운 도메인에 적응하는 데 최적의 트레이드오프는 무엇인가?
  • RQ4제안된 방법이 기존 도메인과 대상 도메인 양쪽에서 표준적인 미세조정 및 재학습보다 뛰어난 성능을 보이는가?
  • RQ5기존 도메인과 대상 도메인 간 훈련 데이터 스케일이 크게 다를 경우, 이 방법의 탄력성은 어떠한가?

주요 결과

  • MTLCF 방법은 초기 모델 대비 원본 LibriSpeech 테스트 세트에서 5% 상대적 CER 감소를 기록하여 효과적인 지식 유지 능력을 입증하였다.
  • Switchboard 대상 도메인에서 MTLCF는 CER 0.2889를 기록하여, 300시간의 대상 데이터를 사용한 미세조정(0.2899)과 재학습(0.3423)을 모두 능가하였다.
  • 120시간의 대상 데이터를 사용할 경우, MTLCF는 대상 세트에서 CER 0.3249를 기록하여, 미세조정(0.3231)과 재학습(0.3788)을 모두 앞섰다.
  • 최적의 초파라미터 설정은 α = 0.5 및 β = 0.1로 확인되었으며, 이 경우 β가 성능 균형에 더 큰 영향을 미쳤다.
  • 다양한 데이터 스케일에서 일관된 성능 향상을 보이며, 불균형한 훈련 데이터 분포에 대한 탄력성을 입증하였다.
  • 양 도메인 모두에서 수렴 속도가 뛰어나, 오래된 지식과 새로운 지식의 효율적 통합 학습이 가능함을 시사하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.