Skip to main content
QUICK REVIEW

[논문 리뷰] OLR 2021 Challenge: Datasets, Rules and Baselines

Binling Wang, Wenxuan Hu|arXiv (Cornell University)|2021. 07. 23.
Time Series Analysis and Forecasting참고 문헌 21인용 수 7
한 줄 요약

이 논문은 OLR 2021 챌린지를 제시하며, 제약 조건이 있는 및 없는 언어 식별(LID)과 제약 조건이 있는 및 없는 다국어 자동 음성 인식(ASR)을 포함한 네 가지 다국어 음성 인식 과제를 소개한다. 기준 성능 시스템으로는 LID에 대해 파이토치 기반의 TDNN x-vector 모델, ASR에 대해 ESPnet를 사용하는 트랜스포머 기반 엔드 투 엔드 ASR 모델을 제공한다. 기준 성능 결과는 ASR 진도 세트에서 CER가 39.4%로 매우 높아, 노이즈가 많고 채널이 다른 데이터를 다루는 데 있어 큰 과제가 있음을 시사하며, 다국어 음성 인식 분야의 향후 연구가 필요하다는 점을 강조한다.

ABSTRACT

This paper introduces the sixth Oriental Language Recognition (OLR) 2021 Challenge, which intends to improve the performance of language recognition systems and speech recognition systems within multilingual scenarios. The data profile, four tasks, two baselines, and the evaluation principles are introduced in this paper. In addition to the Language Identification (LID) tasks, multilingual Automatic Speech Recognition (ASR) tasks are introduced to OLR 2021 Challenge for the first time. The challenge this year focuses on more practical and challenging problems, with four tasks: (1) constrained LID, (2) unconstrained LID, (3) constrained multilingual ASR, (4) unconstrained multilingual ASR. Baselines for LID tasks and multilingual ASR tasks are provided, respectively. The LID baseline system is an extended TDNN x-vector model constructed with Pytorch. A transformer-based end-to-end model is provided as the multilingual ASR baseline system. These recipes will be online published, and available for participants to construct their own LID or ASR systems. The baseline results demonstrate that those tasks are rather challenging and deserve more effort to achieve better performance.

연구 동기 및 목표

  • 언어 식별과 자동 음성 인식 분야에 새로운 실용적인 과제를 도입함으로써 다국어 음성 인식 기술을 발전시키기 위해.
  • 다양한 언어 간의 채널 변동성, 노이즈 환경, 방언 다양성과 같은 실제 문제를 다국어 음성 시스템에서 해결하기 위해.
  • 연구 및 벤치마킹를 지원하기 위해 표준화된 데이터셋, 평가 기준, 기준 성능 시스템을 제공하기 위해.
  • 저자원 및 다국어 ASR 및 LID 시스템에서 엔드 투 엔드 모델과 데이터 증강 기법의 혁신을 장려하기 위해.

제안 방법

  • LID 기준 성능 시스템은 파이토치로 구현된 확장된 TDNN x-vector 모델을 사용하며, 속도 변형 및 SpecAugment를 포함한 데이터 증강 기법으로 훈련된다.
  • SpecAugment는 스펙트로그램 특징에 직접적으로 시간 왜곡, 주파수 마스킹, 시간 마스킹을 적용하여 정확도와 데이터 다양성을 향상시킨다.
  • 다국어 ASR 기준 성능 시스템은 공통된 인코더-디코더 아키텍처를 모든 목표 언어에 적용한 트랜스포머 기반 엔드 투 엔드 모델을 사용하며, 문자 수준의 출력 단위를 사용한다.
  • 모델은 80차원의 멜 필터뱅크 특징과 3차원의 피치 특징을 입력으로 사용하며, 첫 25,000 반복 동안 웜업을 적용한 30 에포크 동안 훈련된다.
  • 언어에 독립적인 아키텍처는 모든 언어가 동일한 네트워크 파rameter를 공유하도록 하여 다양한 언어 가문 간의 공동 훈련을 가능하게 한다.
  • 기준 성능 시스템과 훈련 레시피는 커뮤니티의 사용과 확장이 가능하도록 ESPnet 툴킷과 챌린지 웹사이트를 통해 공개된다.

실험 결과

연구 질문

  • RQ1현재의 LID 및 ASR 시스템은 노이즈가 많거나 채널이 다른 조건에서 제약 조건이 있는 및 없는 다국어 음성 처리에 얼마나 효과적인가?
  • RQ2단일 공유 트랜스포머 기반 엔드 투 엔드 모델이 다양한 동아시아 언어 가문에 걸쳐 얼마나 견고한 성능을 달성할 수 있는가?
  • RQ3속도 변형 및 SpecAugment와 같은 데이터 증강 기법이 저자원 다국어 음성 인식에서 일반화 성능을 어떻게 향상시키는가?
  • RQ4노이즈가 많거나 채널 불일치가 발생하는 음성 문장 처리 시 현재의 다국어 ASR 시스템에서 성능 저하 요인은 무엇인가?
  • RQ5통합된 언어에 독립적인 모델 아키텍처가 하나의 프레임워크에서 언어 식별과 음성 인식을 효과적으로 처리할 수 있는가?

주요 결과

  • 다국어 ASR 기준 성능 시스템은 진도 세트에서 CER 39.4%를 기록하여 다국어 인식 분야에서 향상 여지가 크다는 점을 시사한다.
  • 기준 성능 시스템은 특히 노이즈가 많고 채널이 다른 데이터 처리에 어려움을 겪어 일부 언어에 대해 높은 CER를 기록하며 핵심 과제를 드러낸다.
  • LID 기준 성능 시스템은 채널 간 LID에서 C_avg 0.0239와 EER 2.47%를 기록하여, 심지어 최고 수준의 시스템이라도 실제 환경 조건에서 어려움을 겪음을 입증한다.
  • 호크어, 상하이어, 사천어와 같은 저자원 방언 14개를 포함함으로써 과제의 복잡성과 실용성이 증가한다.
  • 이번 챌린지의 테스트 세트는 이전 버전보다 더 많은 언어를 포함하여 다국어 평가 범위를 확장한다.
  • 기준 성능 레시피와 데이터셋은 공개되어 있어 재현 가능성을 보장하고 다국어 음성 인식 분야의 추가 연구를 촉진한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.