[논문 리뷰] End-to-End ASR for Code-switched Hindi-English Speech
이 논문은 CTC 및 어텐션 손실을 함께 사용하는 다중 작업 학습(MTL)과 오버샘플링을 통한 클래스 불균형 보정을 제안하여 저자원 코드 스위칭 히ند리-영어 음성(학습 데이터 46.65시간)에 대한 엔드 투 엔드 ASR 성능을 향상시킨다. 최고의 모델은 비균형 데이터 대비 5%p 향상된 47.2% WER를 기록했으며, 최적의 MTL 가중치는 λ=0.7–0.9에서 도출되었다.
End-to-end (E2E) models have been explored for large speech corpora and have been found to match or outperform traditional pipeline-based systems in some languages. However, most prior work on end-to-end models use speech corpora exceeding hundreds or thousands of hours. In this study, we explore end-to-end models for code-switched Hindi-English language with less than 50 hours of data. We utilize two specific measures to improve network performance in the low-resource setting, namely multi-task learning (MTL) and balancing the corpus to deal with the inherent class imbalance problem i.e. the skewed frequency distribution over graphemes. We compare the results of the proposed approaches with traditional, cascaded ASR systems. While the lack of data adversely affects the performance of end-to-end models, we see promising improvements with MTL and balancing the corpus.
연구 동기 및 목표
- 50시간 미만의 제한된 데이터로 코드 스위칭 히нд리-영어 음성에 대한 엔드 투 엔드 ASR 모델을 훈련하는 데 도전한다.
- 그래프음소 빈도 분포의 클래스 불균형을 보완하여 저자원 환경에서의 성능 저하를 완화한다.
- 코드 스위칭 ASR에 대해 CTC와 어텐션 기반 손실 함수를 조합한 다중 작업 학습의 효과를 평가한다.
- 코드 스위칭 음성 인식에서 흔히 발생하는 대체 오류를 줄이고 모델의 강건성을 향상시킨다.
제안 방법
- 가중치 매개변수 λ를 사용해 CTC 및 어텐션 기반 손실 함수를 동시에 최적화하는 다중 작업 학습(MTL)을 적용한다.
- 손실의 볼록 조합을 사용: L_total = λ × L_CTC + (1−λ) × L_attention, 여기서 λ ∈ [0,1]은 기여도를 균형 조절한다.
- Adadelta 옵timizer를 사용해 모델을 훈련하고, 검증 손실 기반 조기 정지 기법을 적용하여 15k–21k 개의 경사 하강 스텝 내에 수렴한다.
- 훈련 데이터의 문자 빈도를 균형 잡기 위해 오버샘플링을 구현한다.
- 평균 빈도 이하의 문자를 오버샘플링하여 총 1.2M 문장(기존 41K 문장에서)으로 훈련 세트를 확장한다.
- 추론 단계에서 문자 수준 언어 모델 리스크로링을 적용해 가설 출력 품질을 향상시킨다.
실험 결과
연구 질문
- RQ1CTC 및 어텐션 손실을 함께 사용하는 다중 작업 학습이 저자원 코드 스위칭 히нд리-영어 음성의 엔드 투 엔드 ASR 성능을 향상시킬 수 있는가?
- RQ2코드 스위칭 ASR에 대한 MTL에서 안정적이고 최저의 오류율을 달성하는 데 최적의 손실 가중치 매개변수 λ의 값은 무엇인가?
- RQ3그래프음소 빈도의 불균형이 저자원 환경에서 엔드 투 엔드 ASR 성능에 어떤 영향을 미치는가?
- RQ4소수의 그래프음소를 오버샘플링하면 코드 스위칭 ASR의 WER 향상과 모델 강건성 향상에 어느 정도 기여하는가?
주요 결과
- λ ∈ [0.7, 0.9] 범위에서 다중 작업 학습이 가장 안정적이고 최저의 WER를 기록하며, λ ≈ 0.5일 경우 100% WER를 초과하는 급격한 성능 정점이 나타난다.
- λ = 0.7인 모델이 최고의 성능을 기록했으며, 문자 혼동 행렬을 통해 히нд리 및 영어 그래프음소 모두에서 최소한의 오류가 관찰되었다.
- 오버샘플링을 통한 클래스 불균형 보정으로 최소 문자 빈도가 3에서 약 20,631로 증가했고, 데이터셋 크기는 1.2M 문장으로 증가했다.
- 균형 잡힌 데이터셋은 테스트 WER을 5%p 절감하여 비균형 기준 모델 대비 47.2% WER를 달성했다.
- 균형 잡힌 데이터를 사용한 MTL 모델는 더 빠르게 수렴하고 더 낮은 손실에 도달하지만, 에포크당 훈련 시간은 더 길다.
- 대체 오류는 유사한 그래프음소(예: 위음점이 있는 코음자) 간에 가장 빈번하게 발생하여, 더 나은 언어 모델링이 필요함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.