Skip to main content
QUICK REVIEW

[논문 리뷰] Unified Mandarin TTS Front-end Based on Distilled BERT Model

Yang Zhang, Liqun Deng|arXiv (Cornell University)|2020. 12. 31.
Natural Language Processing Techniques참고 문헌 23인용 수 15
한 줄 요약

이 논문은 원형화된 BERT 모델 기반의 다중 작업 학습 프레임워크를 이용해 통합된 간체중국어 TTS 프론트엔드를 제안하며, 동시에 억양 구조와 다의어 해석을 예측한다. 압축된 모델은 기준 시스템 대비 크기가 25%에 불과하면서도 상태의 기술적 성능을 달성하여 이동 기기에서의 효율적 구현이 가능하며, 다의어 해석 정확도는 0.31% 향상되고 PPH F1 스코어는 1.45% 향상된다.

ABSTRACT

The front-end module in a typical Mandarin text-to-speech system (TTS) is composed of a long pipeline of text processing components, which requires extensive efforts to build and is prone to large accumulative model size and cascade errors. In this paper, a pre-trained language model (PLM) based model is proposed to simultaneously tackle the two most important tasks in TTS front-end, i.e., prosodic structure prediction (PSP) and grapheme-to-phoneme (G2P) conversion. We use a pre-trained Chinese BERT[1] as the text encoder and employ multi-task learning technique to adapt it to the two TTS front-end tasks. Then, the BERT encoder is distilled into a smaller model by employing a knowledge distillation technique called TinyBERT[2], making the whole model size 25% of that of benchmark pipeline models while maintaining competitive performance on both tasks. With the proposed the methods, we are able to run the whole TTS front-end module in a light and unified manner, which is more friendly to deployment on mobile devices.

연구 동기 및 목표

  • 다단계 처리로 인해 누적 오류가 발생하고 계산 비용이 높은 전통적인 간체중국어 TTS 프론트엔드의 복잡한 파이프라인을 단순화하기 위해.
  • 양방향 음운학적 구조 예측(PSP)과 문자-음소 변환(G2P)을 하나의 엔드 투 엔드 학습 가능한 모델로 통합하기 위해.
  • 지식 증류를 이용해 성능을 유지하면서도 모델 크기를 줄여 이동 기기에서의 배포를 가능하게 하기 위해.
  • 간체중국어 TTS에서 다중 작업 학습을 통한 억양 구조 예측과 G2P 작업의 융합 효과를 평가하기 위해.

제안 방법

  • 원시 문자 입력에서 문맥적 언어적 특징을 캡처하기 위해 사전에 훈련된 중국어 BERT 모델을 텍스트 인코더로 사용한다.
  • 공유된 BERT 표현을 이용해 억양 구조 예측(PW, PPH, IPH)과 다의어 해석을 동시에 학습하기 위해 다중 작업 학습을 적용한다.
  • 두 단계 지식 증류 기법을 사용해 BERT 인코더를 더 작고 효율적인 모델로 압축한다(TinyBERT).
  • 다중층 퍼셉트론(MLP)과 소프트맥스를 사용해 다의어 분류를 수행하고, 시퀀스 레이블링 헤드를 사용해 억양 경계 예측을 수행한다.
  • 다의어 해석에 대해 교차 엔트로피 손실을, 억양 구조 예측에 대해 F1 기반 최적화를 사용해 모델을 훈련한다.
  • 교수 모델인 BERT에서 학생 모델인 TinyBERT로 지식을 전달하기 위해 증류 손실을 적용한다.

실험 결과

연구 질문

  • RQ1통합된 딥러닝 모델이 간체중국어 TTS에서 효율성을 향상시키면서도 억양 구조 예측과 다의어 해석을 동시에 수행할 수 있는가?
  • RQ2BERT 기반 다중 작업 학습이 단일 작업 또는 파이프라인 기반 접근 방식에 비해 정확도와 모델 크기 측면에서 어떻게 비교되는가?
  • RQ3지식 증류를 통해 얼마나 모델 크기를 줄일 수 있으며, TTS 프론트엔드 작업의 성능 유지를 유지할 수 있는가?
  • RQ4압축된 BERT 기반 모델이 전통적인 규칙 기반 및 통계 기반 모델(WFST, CRF 등)에 비해 정확도와 배포 가능성 측면에서 뛰어나다고 할 수 있는가?

주요 결과

  • 압축된 TinyBERT-MTL 모델은 기준 WFST 기반 G2P 모델보다 다의어 해석 정확도가 0.31% 높다.
  • 기준 파이프라인 시스템에 비해 PPH F1 스코어는 1.45% 향상되고 IPH F1 스코어는 0.52% 향상된다.
  • 최종적으로 압축된 모델 크기는 기준 모델들의 합산 크기(199MB)의 25%에 불과하며(47MB 대비), 저장 및 배포 비용을 크게 감소시킨다.
  • 완전한 BERT-MTL에 비해 약간의 성능 저하가 있었지만, 압축된 모델은 CPU에서 21.8ms의 빠른 추론 시간을 기록하며 경쟁력 있는 성능을 유지한다.
  • fine-tuned BERT 설정에서 BLSTM보다 MLP를 사용한 다의어 예측이 더 우수한 성능을 보이며, 고정된 BERT 인코더에서 더 나은 문맥 학습이 가능함을 시사한다.
  • 예측 헤드에 CRF 레이어를 추가하면 성능이 약간 저하되며, 이는 BERT의 문맥 모델링이 레이블 전이 모델링에 비해 더 효과적임을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.