Skip to main content
QUICK REVIEW

[논문 리뷰] Scribosermo: Fast Speech-to-Text models for German and other Languages

Daniel Bermuth, Alexander Poeppel|arXiv (Cornell University)|2021. 10. 15.
Speech Recognition and Synthesis참고 문헌 19인용 수 4
한 줄 요약

이 논문은 라즈베리 파이와 같은 저전력 하드웨어에서 실시간으로 작동하면서 독일어 벤치마크에서 최신 기술 수준의 성능을 달성하는 소형이고 효율적인 독일어, 스파니시, 프랑스어 전용 음성-텍스트 모델인 Scribosermo를 소개한다. 이 모델들은 사전 학습된 영어 모델에서의 전이 학습과 새로운 알파벳 적응 기법을 활용하여, 최소한의 데이터와 소비자용 하드웨어로도 높은 정확도를 달성한다.

ABSTRACT

Recent Speech-to-Text models often require a large amount of hardware resources and are mostly trained in English. This paper presents Speech-to-Text models for German, as well as for Spanish and French with special features: (a) They are small and run in real-time on microcontrollers like a RaspberryPi. (b) Using a pretrained English model, they can be trained on consumer-grade hardware with a relatively small dataset. (c) The models are competitive with other solutions and outperform them in German. In this respect, the models combine advantages of other approaches, which only include a subset of the presented features. Furthermore, the paper provides a new library for handling datasets, which is focused on easy extension with additional datasets and shows an optimized way for transfer-learning new languages using a pretrained model from another language with a similar alphabet.

연구 동기 및 목표

  • 라즈베리 파이와 같은 임베디드 시스템에서 효율적으로 작동할 수 있는 소형이고 빠른 독일어 및 기타 언어 전용 음성-텍스트 모델을 개발하는 것.
  • 상대적으로 작은 데이터셋을 사용하여 고성능 서버 자원에 의존하지 않고도 소비자용 하드웨어에서 이러한 모델을 훈련시킬 수 있도록 하는 것.
  • 독일어 음성 인식 성능을 향상시켜 Tuda 데이터셋에서 최신 기술 수준의 결과를 달성하는 것.
  • 유사한 알파벳을 공유하는 언어들 간의 다국어 전이 학습과 데이터셋 처리를 위한 간편하고 확장 가능한 프레임워크를 제공하는 것.
  • 영어에서 다른 라틴어 알파벳을 사용하는 로망스어권 언어로의 제로샷 또는 소수의 샘플을 이용한 전이 학습이 단일 단계의 적응 과정을 통해 효과적으로 이루어질 수 있도록 하는 것.

제안 방법

  • 모델들은 추론 속도와 낮은 메모리 사용을 위해 최적화된 경량 신경망 아키텍처를 기반으로 하여 마이크로컨트롤러에서 실시간 추론이 가능하다.
  • 사전 학습된 영어 음성-텍스트 모델이 새로운 알파벳 적응 기법을 통해 단일 훈련 단계에서 목표 언어의 문자 집합에 맞게 출력 레이어를 재구성함으로써 미세조정된다.
  • 다양한 음성 인식 프레임워크 간의 데이터셋 로딩, 전처리 및 변환을 간편하게 하기 위해 새로운 오픈소스 라이브러리인 corcua가 도입된다.
  • 데이터 전처리 과정에는 지속시간, 번역 길이, 말하기 속도 기준 임계값을 기반으로 자동으로 오디오 및 전사 파일을 정리하여 훈련의 안정성과 속도를 향상시킨다.
  • 디코딩 후에 5-그램 언어 모델 리스크로링을 적용하여, 특히 독일어의 경우 전사 품질을 향상시킨다.
  • 유사한 알파벳을 공유하는 언어들(예: 영어 → 스파니시, 스파니시 → 이タ리아노) 간에 전이 학습을 적용하며, 공통된 인코더를 사용하고 유일하게 출력 레이어만을 적응시킨다.

실험 결과

연구 질문

  • RQ1소형이고 효율적인 음성 인식 모델이 저전력 장치에서 실시간으로 작동하면서 독일어, 스파니시, 프랑스어 벤치마크에서 경쟁력 있는 성능을 달성할 수 있는가?
  • RQ2사전 학습된 영어 모델에서의 전이 학습이 새로운 언어 모델 훈련을 위한 데이터 및 하드웨어 요구량을 크게 줄일 수 있는가?
  • RQ3단일 단계의 알파벳 적응 기법이 기존의 미세조정 방식에 비해 새로운 언어에 대해 속도와 성능 면에서 뛰어나게 작용하는가?
  • RQ4corcua와 같은 통합되고 확장 가능한 데이터셋 처리 파이프라인은 다양한 다국어 데이터셋을 음성 인식 훈련에 쉽게 통합하는 데 도움이 되는가?
  • RQ5대규모 데이터나 고성능 훈련 인프라 없이도 여러 개의 소규모 데이터셋을 조합함으로써 모델 성능을 향상시킬 수 있는 정도는 어느 정도인가?

주요 결과

  • Scribosermo 모델은 독일어 CommonVoice 데이터셋에서 WER 6.6%를 기록하여 이전의 모든 모델을 능가하며 독일어 음성 인식 분야에서 새로운 최신 기술 수준을 수립한다.
  • 독일어 Tuda 데이터셋에서 모델은 WER 10.2%를 기록하여, IMS-Speech의 최고 수준의 기존 모델들과 경쟁 가능한 성능을 달성한다.
  • 모델은 라즈베리 파이에서 실시간으로 작동하여 저전력 소비로 엣지 및 임베디드 환경에 적합함을 입증한다.
  • 다양한 출처에서 확보한 2.4천 시간의 독일어 데이터로만 훈련해도 뛰어난 성능을 달성함으로써 높은 데이터 효율성을 보여준다.
  • 전이 학습 방식을 통해 영어에서 스파니시(워드 에러율: 10.0%)와 프랑스어(워드 에러율: 11.0%)로의 효과적인 적응이 가능하며, 각각 817시간과 1028시간의 데이터로만 훈련되었다.
  • corcua 라이브러리는 777시간 분량의 데이터에 대해 audiomate를 사용할 경우 12시간이 소요되던 데이터 변환 시간을 3시간 이내로 단축시켜 데이터 파이프라인의 효율성을 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.