Skip to main content
QUICK REVIEW

[論文レビュー] DARTS-ASR: Differentiable Architecture Search for Multilingual Speech Recognition and Adaptation

Yi‐Chen Chen, Jui-Yang Hsu|arXiv (Cornell University)|May 13, 2020
Speech Recognition and Synthesis参考文献 30被引用数 13
ひとこと要約

本稿では、多言語および単言語音声認識のためのニューラルネットワークアーキテクチャとモデル重みを同時に最適化する微分可能アーキテクチャ探索フレームワーク、DARTS-ASRを提案する。連続的なアーキテクチャ空間上で勾配ベースの探索を適用することにより、IARPA BABELデータセットにおいて、固定トポロジーベースラインと比較して単言語設定で10.2%、多言語設定で10.0%の相対的文字誤り率(CER)の低減を達成した。

ABSTRACT

In previous works, only parameter weights of ASR models are optimized under fixed-topology architecture. However, the design of successful model architecture has always relied on human experience and intuition. Besides, many hyperparameters related to model architecture need to be manually tuned. Therefore in this paper, we propose an ASR approach with efficient gradient-based architecture search, DARTS-ASR. In order to examine the generalizability of DARTS-ASR, we apply our approach not only on many languages to perform monolingual ASR, but also on a multilingual ASR setting. Following previous works, we conducted experiments on a multilingual dataset, IARPA BABEL. The experiment results show that our approach outperformed the baseline fixed-topology architecture by 10.2% and 10.0% relative reduction on character error rates under monolingual and multilingual ASR settings respectively. Furthermore, we perform some analysis on the searched architectures by DARTS-ASR.

研究の動機と目的

  • 自動音声認識(ASR)におけるニューラルアーキテクチャ設計の自動化を図り、人的専門知識や手動によるハイパーパramータチューニングへの依存を低減すること。
  • 微分可能アーキテクチャ探索(DARTS)を多言語ASRに拡張し、複数の言語にわたるアーキテクチャと重みの共同最適化を可能にすること。
  • DARTS-ASRが、手作業で設計されたモデルを上回る汎用性と高い性能を示すアーキテクチャを発見できるかどうかを検証すること。

提案手法

  • 探索空間は、K個のノードを持つ有向無閉路グラフ(DAG)として定義され、各ノードは特徴マップを表し、エッジは集合𝔽(例:3x3Conv、MaxPool2d、スキップ接続)からの学習可能な演算を表す。
  • アーキテクチャ演算は、ソフトマックス重み付きゲートを用いて微分可能に緩和される:g_{i,j}(H_j) = Σ_f exp(α_f^{i,j}) / Σ_f' exp(α_f'^{i,j}) × f(H_j) であり、勾配ベースの最適化が可能になる。
  • モデルは2ストリーム最適化を用いて訓練される:アーキテクチャパラメータαとネットワーク重みθが、検証セット上で勾配降下法を用いて同時に更新される。
  • 多言語ASRでは、モデルをソース言語で事前学習し、ターゲット言語で微調整する3つの戦略を用いる:パラメータのみの微調整、アーキテクチャとパラメータの両方の微調整、またはアーキテクチャのプルーニングとその後の微調整。
  • 最終的なアーキテクチャは、各エッジについて上位3つの演算(α値が最大のもの)に基づいて選択され、性能損失を最小限に抑えつつ効率的な推論が可能になる。
  • フレームワークは、VGG-Small、VGG-Large、および固定トポロジーベースラインと比較して、IARPA BABEL多言語ASRデータセットで評価された。

実験結果

リサーチクエスチョン

  • RQ1微分可能アーキテクチャ探索(DARTS)は、人為的に設計されたものよりも優れたアーキテクチャを発見できるように、多言語音声認識に効果的に適用可能か?
  • RQ2DARTS-ASRが発見したアーキテクチャは、多言語ASRにおける複数の低リソース言語にわたって汎用性を示すか?
  • RQ3DARTS-ASRによるアーキテクチャと重みの共同最適化は、固定トポロジーアーキテクチャの標準的な微調整と比較して、文字誤り率(CER)の観点で、単言語および多言語設定においてどのように異なるか?
  • RQ4DARTS-ASRから得られるアーキテクチャ的パターンは、単言語および多言語ASRにおいてどのような特徴を示し、言語間でどのように異なるか?
  • RQ5DARTS-ASRから導出されたプルーニング済みアーキテクチャは、計算コストを削減しながらも性能を維持できるか?

主な発見

  • DARTS-ASRは、IARPA BABELデータセットにおける単語言語ASRにおいて、固定トポロジーベースラインと比較して10.2%の相対的CER低減を達成した。
  • 多言語ASRにおいて、同様のベースラインと比較して10.0%の相対的CER低減を達成し、言語間での強い汎用性を示した。
  • 「アーキテクチャとパラメータの両方を適応」する微調整戦略が最良の性能を示したが、「パラメータのみを適応」する戦略や「プルーニング済みアーキテクチャとパラメータの両方を適応」する戦略もわずかに劣るにとどまり、ロバストネスと効率化の可能性を示した。
  • 多言語ASRにおける探索アーキテクチャは、特に深層部において言語間で非常に類似しており、共同事前学習から汎用的なアーキテクチャが出現していることを示唆している。
  • 単語言語ASRでは、言語ごとにアーキテクチャの差が顕著に現れた(例:ベトナム語とスワヒリ語は類似、タミル語とクルマンジ語は相違)。これは言語固有の最適化を反映している。
  • プルーニング済みアーキテクチャは、複雑さを低減しながらも高い性能を維持しており、DARTS-ASRが顕著な精度損失を伴わずに効率的なモデル圧縮を可能にしていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。