[論文レビュー] A Multi-Task Learning Framework for Overcoming the Catastrophic Forgetting in Automatic Speech Recognition
本稿では、エンドツーエンド自動音声認識(ASR)における深刻な忘却を軽減するため、マルチタスク学習(MTL)フレームワークMTLCFを提案する。この手法は、元の知識の保持と新しいドメイン固有の知識の学習を同時に実行することで、性能を向上させる。バランスの取れた損失重みを用いて2つのタスク(知識保持と新しいタスクへの適応)を共同最適化することで、元の(LibriSpeech)およびターゲット(Switchboard)データセットの両方で最先端の性能を達成し、微調整と比較して元のデータセットで相対的に5%のCER低減を実現した。
Recently, data-driven based Automatic Speech Recognition (ASR) systems have achieved state-of-the-art results. And transfer learning is often used when those existing systems are adapted to the target domain, e.g., fine-tuning, retraining. However, in the processes, the system parameters may well deviate too much from the previously learned parameters. Thus, it is difficult for the system training process to learn knowledge from target domains meanwhile not forgetting knowledge from the previous learning process, which is called as catastrophic forgetting (CF). In this paper, we attempt to solve the CF problem with the lifelong learning and propose a novel multi-task learning (MTL) training framework for ASR. It considers reserving original knowledge and learning new knowledge as two independent tasks, respectively. On the one hand, we constrain the new parameters not to deviate too far from the original parameters and punish the new system when forgetting original knowledge. On the other hand, we force the new system to solve new knowledge quickly. Then, a MTL mechanism is employed to get the balance between the two tasks. We applied our method to an End2End ASR task and obtained the best performance in both target and original datasets.
研究の動機と目的
- エンドツーエンドASRシステムにおけるドメイン適応中における深刻な忘却を解消すること。
- 微調整(元のドメインでの性能低下を引き起こす)および再訓練(両ドメインを同時に最適化できない)の限界を克服すること。
- 固定アーキテクチャを用いて、大規模ASRタスクにスケーラブルに生涯学習の原則を適用すること。
- 知識保持と新しいタスク学習の両方をバランスよく最適化するマルチタスク学習メカニズムを開発すること。
提案手法
- ドメイン適応を、元のモデル知識の保持と新しいドメイン固有の知識の学習という2つの独立したタスクとして定式化する。
- ハイパーパrameter α と β を用いて、2つのタスク間のトレードオフを制御するバランスの取れたMTL目的関数を導入する。
- パラメータの更新が元の重みから逸脱しないようにL2正則化を適用し、学習済み知識の保持を図る。
- 計算効率とスケーラビリティを維持するために、固定されたニューラルネットワークアーキテクチャを採用する。
- タスク固有の損失をバランスの取れた重み付けで組み合わせた共同損失関数を用いてモデルを最適化する。
- ハイパーパrameter α と β を調整し、知識保持(タスク1)と新しいタスクのパフォーマンス(タスク2)の相対的な重要度を制御する。
実験結果
リサーチクエスチョン
- RQ1マルチタスク学習フレームワークは、ドメイン適応中のエンドツーエンドASRにおける深刻な忘却を効果的に軽減できるか?
- RQ2知識保持と新しいタスク学習のバランスが、元のドメインおよびターゲットドメインのパフォーマンスに与える影響は何か?
- RQ3ハイパーパrameter α と β において、元の知識の保持と新しいドメインへの適応の最適なトレードオフは何か?
- RQ4提案手法は、元のドメインおよびターゲットドメインの両方で、標準的な微調整および再訓練を上回る性能を発揮するか?
- RQ5元のドメインとターゲットドメインの間でトレーニングデータ量に顕著な差がある場合、この手法のロバスト性はいかがなものか?
主な発見
- MTLCF手法は、初期モデルと比較して、元のLibriSpeechテストセットで相対的に5%のCER低減を達成し、知識保持の有効性を示した。
- Switchboardターゲットドメインでは、MTLCFがCER 0.2889を達成し、微調整(0.2899)および再訓練(0.3423)を上回った(ターゲットデータ300時間使用時)。
- 120時間のターゲットデータを使用した場合、MTLCFはターゲットセットでCER 0.3249を達成し、微調整(0.3231)および再訓練(0.3788)を上回った。
- 最適なハイパーパrameter設定は α = 0.5 および β = 0.1 であり、β がパフォーマンスのバランスにより強い影響を与えた。
- 異なるデータスケールにおいて一貫した改善が得られたことから、不均衡なトレーニングデータ分布に対してもロバストであることが証明された。
- 両ドメインにおける収束速度が優れており、古くからの知識と新しい知識の効率的な共同学習が可能であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。