[논문 리뷰] Dialectal Speech Recognition and Translation of Swiss German Speech to Standard German Text: Microsoft's Submission to SwissText 2021
이 논문은 스위스 독일어 음성-텍스트 번역 공동 과제인 SwissText 2021에서 마이크로소프트가 수상한 접근 방식을 제시한다. 이는 스위스 독일어 발음과 표준 독일어 번역어를 직접 연결하는 어휘를 포함한 하이브리드 음성 인식(ASR) 시스템을 결합한 것으로, 고독일어 ASR 모델에서의 전이 학습, 방언 특화 형태론을 고려한 맞춤형 제1단계 언어 모델, 제2단계 신경망 재평가 기반의 성능 향상 기법을 사용하여 빌드된 시스템이다. 이 시스템은 빈 테스트 세트에서 46.04% BLEU 점수를 기록했으며, 두 번째로 좋은 성능을 낸 시스템 대비 12% 상대적 향상률을 기록했다.
This paper describes the winning approach in the Shared Task 3 at SwissText 2021 on Swiss German Speech to Standard German Text, a public competition on dialect recognition and translation. Swiss German refers to the multitude of Alemannic dialects spoken in the German-speaking parts of Switzerland. Swiss German differs significantly from standard German in pronunciation, word inventory and grammar. It is mostly incomprehensible to native German speakers. Moreover, it lacks a standardized written script. To solve the challenging task, we propose a hybrid automatic speech recognition system with a lexicon that incorporates translations, a 1st pass language model that deals with Swiss German particularities, a transfer-learned acoustic model and a strong neural language model for 2nd pass rescoring. Our submission reaches 46.04% BLEU on a blind conversational test set and outperforms the second best competitor by a 12% relative margin.
연구 동기 및 목표
- 낮은 자원을 가진 스위스 독일어 어조의 음성 인식 및 표준 독일어 텍스트로의 번역 과제를 해결하기 위해.
- 스위스 독일어와 표준 독일어 간의 표준화된 철자법 부족 및 상당한 철자, 어휘, 문법적 차이를 극복하기 위해.
- 전이 학습과 구조화된 언어 모델링을 통해 낮은 자원 환경에서의 방언 특화 음성 인식 성능 향상을 위해.
- 방언 특화 음성 인식 및 번역 분야에서 최신 기술 수준의 성능을 달성하기 위해 공개 대회에서의 성과를 높이기 위해.
제안 방법
- 스위스 독일어 발음과 표준 독일어 번역어를 직접 연결하는 어휘를 포함한 하이브리드 자동 음성 인식(ASR) 시스템으로, 복합어 및 축약형과 같은 형태론적 현상을 포함한다.
- 스위스 독일어의 복합어 및 축약형 현상을 특별히 다룰 수 있도록 설계된 제1단계 언어 모델로, 병합된 단어 쌍에 대한 통합 학습을 수행한다.
- 10,000시간 분량의 고독일어 ASR 사전학습 데이터셋에서 전이 학습을 통해 미세조정된 LC-BLSTM 음향 모델로, 80차원의 로그멜 필터뱅크 특징과 160차원의 컨텍스트 연결을 사용한다.
- 상위 100개의 ASR 가설에 대해 재평가하기 위한 제2단계 신경망 기반 언어 모델로, 번역 오류를 수정하기 위해 강력한 트랜스포머 기반 언어 모델을 사용한다.
- 특히 초기 학습 단계에서 발음의 모호성을 줄이기 위해 훈련 중에 이sov음화된 스위스 독일어 형태를 강제 정렬에 활용한다.
- 단어 쌍을 병합하고 병합되지 않은 언어 모델 구성 요소와 통합하여 축약형 'haben#wir'과 같은 축약형을 어휘 및 언어 모델에 통합한다.
실험 결과
연구 질문
- RQ1스위스 독일어의 형태론적 복잡성(복합어 및 축약형 포함)을 다룰 수 있도록 하이브리드 ASR 시스템을 어떻게 개선할 수 있는가?
- RQ2고자원 표준 독일어 ASR 모델에서의 전이 학습이 낮은 자원 환경의 스위스 독일어 음성 인식 성능 향상에 얼마나 기여하는가?
- RQ3스위스 독일어 형태론에 특화된 언어 모델이 표준 언어 모델 대비 인식 및 번역 품질 향상에 얼마나 기여하는가?
- RQ4제2단계 신경망 재평가 기법이 방언 특화 음성-텍스트 번역 과제에서 번역 오류를 줄이고 BLEU 점수를 향상시키는 데 얼마나 효과적인가?
주요 결과
- 시스템은 빈 대화형 테스트 세트에서 46.04% BLEU 점수를 기록했으며, 두 번째로 좋은 성능을 낸 경쟁자 대비 12% 상대적 향상률을 기록했다.
- 전이 학습을 통해 스위스 의회 데이터셋에서부터 완전히 새로 학습하는 것에 비해 WER이 8.4% 감소하고 BLEU 점수는 11.6% 향상되었다.
- 내부 스위스 독일어 데이터 50시간을 추가로 활용함으로써 WER은 2.3% 감소하고 BLEU 점수는 2.5% 향상되었다.
- 강력한 신경망 언어 모델을 사용한 제2단계 재평가 기법을 통해 WER은 5.8% 감소하고 BLEU 점수는 8.9% 향상되었다.
- 제거 실험 결과 각 구성 요소(전이 학습, 내부 데이터, 재평가)가 최종 성능 향상에 기여하는 것으로 확인되었다.
- 전체 시스템은 약 1200 GPU시간을 소모하여 학습되었으며, 25 에포크 동안 8개의 GPU를 사용하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.