[論文レビュー] Unified Mandarin TTS Front-end Based on Distilled BERT Model
本稿では、蒸留されたBERTモデルを基盤とするマルチタスク学習フレームワークを用いて、発音構造と多音字の意味解釈を統合的に予測する統合型中国語TTSフロントエンドを提案する。蒸留モデルは、ベースラインシステムの25%のサイズで最先端の性能を達成し、モバイルデバイスへの効率的なデプロイを可能にするとともに、多音字の意味解釈で0.31%、PPH F1スコアで1.45%の精度向上を達成した。
The front-end module in a typical Mandarin text-to-speech system (TTS) is composed of a long pipeline of text processing components, which requires extensive efforts to build and is prone to large accumulative model size and cascade errors. In this paper, a pre-trained language model (PLM) based model is proposed to simultaneously tackle the two most important tasks in TTS front-end, i.e., prosodic structure prediction (PSP) and grapheme-to-phoneme (G2P) conversion. We use a pre-trained Chinese BERT[1] as the text encoder and employ multi-task learning technique to adapt it to the two TTS front-end tasks. Then, the BERT encoder is distilled into a smaller model by employing a knowledge distillation technique called TinyBERT[2], making the whole model size 25% of that of benchmark pipeline models while maintaining competitive performance on both tasks. With the proposed the methods, we are able to run the whole TTS front-end module in a light and unified manner, which is more friendly to deployment on mobile devices.
研究の動機と目的
- 段階的な処理が複雑で、キャスケードエラーと高い計算コストに苦しむ従来の中国語TTSフロントエンドの多段階パイプラインを簡素化すること。
- 発音構造予測(PSP)と音素変換(G2P)を統合的に1つのエンドツーエンドで学習可能なモデルに統合すること。
- 知識蒸留を用いてモデルサイズを削減し、パフォーマンスを損なわず、モバイルデバイスへのデプロイを可能にすること。
- マルチタスク学習によるBERTを用いた中国語TTSにおける発音構造予測とG2Pタスクの統合的アプローチの有効性を評価すること。
提案手法
- 生の文字入力を用いて文脈的な言語的特徴を捉えるために、事前学習済み中国語BERTモデルをテキストエンコーダーとして使用する。
- 共有されたBERT表現を用いて、発音構造予測(PW, PPH, IPH)と多音字の意味解釈を同時に学習するマルチタスク学習を採用する。
- 2段階の知識蒸留技術(TinyBERT)を用いて、BERTエンコーダーをより小型で効率的なモデルに圧縮する。
- 多音字分類にはソフトマックスを用いた多層パーセプトロン(MLP)と、発音境界予測にはシーケンスラベル付けヘッドを用いる。
- 多音字の意味解釈には交差エントロピー損失、発音構造予測にはF1スコアに基づく最適化を用いてモデルを学習する。
- 教師モデルのBERTから学生モデルのTinyBERTへ知識を転送するために、蒸留損失を適用する。
実験結果
リサーチクエスチョン
- RQ1統合的ディープラーニングモデルは、中国語TTSにおいて発音構造予測と多音字の意味解釈を統合的に実行し、効率性を向上させることができるか?
- RQ2マルチタスク学習によるBERTは、単一タスクやパイプラインベースのアプローチと比較して、精度とモデルサイズの点で優れているか?
- RQ3知識蒸留は、TTSフロントエンドタスクのパフォーマンスを損なわず、どの程度モデルサイズを削減できるか?
- RQ4蒸留されたBERTベースのモデルは、従来のルールベースおよび統計的モデル(例:WFST, CRF)と比較して、精度とデプロイ可能性の両面で優れているか?
主な発見
- 蒸留されたTinyBERT-MTLモデルは、ベースラインのWFSTベースG2Pモデルと比較して、多音字の意味解釈精度が0.31%高い。
- ベンチマークパイプラインシステムと比較して、PPH F1スコアは1.45%、IPH F1スコアは0.52%向上した。
- 最終的な蒸留モデルは、統合されたベンチマークモデル(47 MB 対 199 MB)の25%のサイズにまで削減され、ストレージおよびデプロイコストを顕著に低減した。
- 完全なBERT-MTLモデルと比較してわずかに性能が低下したが、CPU上での推論時間はわずか21.8 msで、競争力のある結果を維持した。
- 微調整されたBERT設定において、MLPによる多音字予測がBLSTMを上回ったことから、固定されたBERTエンコーダーからの文脈的学習がより効果的であることが示された。
- 予測ヘッドにCRFレイヤーを追加すると性能がわずかに低下したため、BERTの文脈的モデリングが、ラベル遷移モデリングにおいてCRFよりも優れていることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。