[논문 리뷰] Learning not to Discriminate: Task Agnostic Learning for Improving Monolingual and Code-switched Speech Recognition
이 논문은 도메인 적응형 훈련을 활용한 작업 무관 학습 접근법을 제안하여 동시에 다국어 및 코드 스위칭 음성 인식 성능을 향상시킨다. 공유 레이어를 작업 정체성(다국어 대비 코드 스위칭)에 대해 불변으로 만들기 위해 적대적 판별기로 훈련시킴으로써, 두 작업 간에 일반화 가능한 공유 특징을 학습하게 하여, 세 개의 언어 조합에서 다국어 테스트 세트에서 최대 3.1% 감소, 코드 스위칭 테스트 세트에서 최대 2.2% 감소한 WER를 달성한다.
Recognizing code-switched speech is challenging for Automatic Speech Recognition (ASR) for a variety of reasons, including the lack of code-switched training data. Recently, we showed that monolingual ASR systems fine-tuned on code-switched data deteriorate in performance on monolingual speech recognition, which is not desirable as ASR systems deployed in multilingual scenarios should recognize both monolingual and code-switched speech with high accuracy. Our experiments indicated that this loss in performance could be mitigated by using certain strategies for fine-tuning and regularization, leading to improvements in both monolingual and code-switched ASR. In this work, we present further improvements over our previous work by using domain adversarial learning to train task agnostic models. We evaluate the classification accuracy of an adversarial discriminator and show that it can learn shared layer parameters that are task agnostic. We train end-to-end ASR systems starting with a pooled model that uses monolingual and code-switched data along with the adversarial discriminator. Our proposed technique leads to reductions in Word Error Rates (WER) in monolingual and code-switched test sets across three language pairs.
연구 동기 및 목표
- 코드 스위칭 데이터로의 피니팅 시 다국어 ASR 성능 저하 문제를 해결하기 위해.
- 작업 정체성(다국어 대비 코드 스위칭)에 대해 불변인 공유 음성 표현을 학습하면서도 작업별 특화된 구분 능력을 유지하기 위해.
- 적대적 훈련을 통해 다국어 및 코드 스위칭 음성 인식 성능을 동시에 향상시키기 위해.
- 표준 피니팅 또는 정규화 전략과 비교하여 작업 무관 공유 레이어가 더 나은 일반화 성능을 보이는지 검증하기 위해.
- 향상된 성능을 위해 작업별 특화 레이어를 적대적 공유 레이어와 통합하는 방법을 탐색하기 위해.
제안 방법
- 공유 레이어와 작업별 특화 출력 헤드를 사용하여 풀링된 다국어 및 코드 스위칭 데이터를 기반으로 엔드 투 엔드 ASR 모델을 훈련한다.
- 공유 레이어 특징의 다국어 대비 코드 스위칭 정체성 분류 정확도를 최소화하기 위해 적대적 판별기에 기울기 반전 레이어(GRL)를 도입한다.
- 다국어 ASR 손실, 코드 스위칭 ASR 손실, 적대적 손실을 조합하여 최적화함으로써 작업 무관 공유 특징을 유도하는 공동 손실 함수를 사용한다.
- 공유 레이어 특징을 기반으로 음성 문장을 다국어 또는 코드 스위칭로 분류하는 다중 작업 적대적 판별기를 사용한다.
- 다국어, 코드 스위칭, 적대적 목적을 위한 별도의 손실 구성 요소를 사용하여 확률적 경사 하강법으로 모델 파라미터를 업데이트한다.
- 세 언어 조합의 다국어 및 코드 스위칭 테스트 세트에서 WER를 사용하여 성능을 평가한다.
실험 결과
연구 질문
- RQ1적대적 훈련을 통해 다국어 및 코드 스위칭 음성 인식 성능 향상에 기여하는 작업 무관 공유 표현을 학습할 수 있는가?
- RQ2공유 레이어 이후에 작업별 특화 레이어를 포함시키면, 단순한 적대적 훈련보다 성능 향상이 더 이루어지는가?
- RQ3표준 분류기 대비 적대적 판별기를 사용할 경우 공유 레이어가 불변 특징을 학습할 수 있는가?
- RQ4기존의 피니팅 및 정규화 전략과 비교하여 제안된 방법이 다국어 및 코드 스위칭 테스트 세트에서 WER 측면에서 어떻게 성능을 내는가?
- RQ5다국어 및 코드 스위칭 환경에서 작업 무관 공유 레이어가 모델 일반화에 어떤 영향을 미치는가?
주요 결과
- 다중 작업 적대적 모델(Exp6)이 모든 테스트 세트에서 가장 낮은 WER를 기록하였으며, 풀링 모델(Exp3) 대비 타밀-영어 다국어에서 3.1% 감소, 타밀-영어 코드 스위칭에서 2.2% 감소하였다.
- 적대적 작업 무관 풀링 모델(Exp5)은 최고의 피니팅 모델(Exp4) 대비 타밀-영어 다국어에서 1.21% 감소, 타밀-영어 코드 스위칭에서 1.28% 감소한 WER를 기록하였다.
- 분류 실험 결과, 적대적 판별기의 검증 정확도는 약 50%로 일정하게 유지되었으며, 이는 공유 레이어가 작업 불변 특징을 학습했음을 시사한다. 반면 표준 분류기의 정확도는 증가하여 작업별 특화된 특징 학습을 의미한다.
- 작업별 특화 레이어와 적대적 훈련을 병행한 모델이 세 언어 조합(Tamil-English, Telugu-English, Gujarati-English)에서 모두 최고의 성능을 기록하였다.
- 모든 언어 조합에서 일관된 WER 감소가 관찰되었으며, 가장 큰 절대적 개선은 타밀-영어에서 이루어졌고, 다국어에서 3.1%, 코드 스위칭에서 2.2%의 감소를 기록하였다.
- 결과는 작업 무관 공유 레이어가 다국어 음성 인식 성능를 유지하면서도 코드 스위칭 인식 성능 향상에 필수적임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.