Skip to main content
QUICK REVIEW

[論文レビュー] Speech recognition with quaternion neural networks

Titouan Parcollet, Mirco Ravanelli|arXiv (Cornell University)|Nov 21, 2018
Music and Audio Processing参考文献 23被引用数 14
ひとこと要約

本稿では、自己特徴の依存関係(例:メルエネルギーとその微分)とフレーム間の時間的関係を、実数値ネットワークよりも効率的に同時にモデル化するため、クォータニオン代数を活用したクォータニオンニューラルネットワーク(QNNs)を提案する。TIMITにおける実験では、同等の実数値モデルと比較して最大3.96倍少ないパラメータで最先端の発音誤り率を達成した。

ABSTRACT

Neural network architectures are at the core of powerful automatic speech recognition systems (ASR). However, while recent researches focus on novel model architectures, the acoustic input features remain almost unchanged. Traditional ASR systems rely on multidimensional acoustic features such as the Mel filter bank energies alongside with the first, and second order derivatives to characterize time-frames that compose the signal sequence. Considering that these components describe three different views of the same element, neural networks have to learn both the internal relations that exist within these features, and external or global dependencies that exist between the time-frames. Quaternion-valued neural networks (QNN), recently received an important interest from researchers to process and learn such relations in multidimensional spaces. Indeed, quaternion numbers and QNNs have shown their efficiency to process multidimensional inputs as entities, to encode internal dependencies, and to solve many tasks with up to four times less learning parameters than real-valued models. We propose to investigate modern quaternion-valued models such as convolutional and recurrent quaternion neural networks in the context of speech recognition with the TIMIT dataset. The experiments show that QNNs always outperform real-valued equivalent models with way less free parameters, leading to a more efficient, compact, and expressive representation of the relevant information.

研究の動機と目的

  • クォータニオン値のニューラルネットワーク(QNNs)が、内部的および外部的依存関係を同時に捉えることで、音声認識における多次元音響特徴をより効果的にモデル化できるかどうかを調査すること。
  • エンドツーエンドおよびHMMベースのASRフレームワークの両方において、クォータニオン畳み込み(QCNN)およびクォータニオン再帰(QRNN)ネットワークの性能を、それらの実数値対応モデルと比較して評価すること。
  • QNNsが、実数値モデルと比較して顕著に少ない学習可能なパラメータで、より低い発音誤り率(PER)を達成できるかどうかを特定すること。
  • クォータニオンの固有構造、特にハミルトン積を介して、音響特徴のより効率的で汎用性の高い表現が可能かどうかを検討すること。

提案手法

  • 本稿では、標準的なTIMIT音響特徴(メルフィルタバンクエネルギー、一次および二次微分)を処理するために、クォータニオン値の畳み込みニューラルネットワーク(QCNN)および再帰ニューラルネットワーク(QRNN)を採用する。
  • クォータニオン代数を用いて、各時間フレームごとの三次元特徴ベクトルを単一のエンティティとして符号化し、ハミルトン積を介して特徴内の内部関係を学習可能にする。
  • 標準的なバックプロパゲーションとRMSProp最適化、ReLU/Tanh活性化関数、ドロップアウトを用いてモデルを訓練し、実数およびクォータニオンネットワークの両方でハイパーパrameterを最適化した。
  • エンドツーエンド学習では、QCNNとCNNを直接比較した。ハイブリッドシステムでは、QRNNとRNNをHMM状態の予測に訓練し、KaldiのWFSTフレームワークを用いてデコードした。
  • 同等の実数およびクォータニオンモデル間のパラメータ数を直接比較し、クォータニオンパラメータは先行研究からの標準的手法を用いて初期化した。
  • QNNsのコア演算としてハミルトン積を用い、多次元特徴群間の相互作用を効率的に計算可能にした。

実験結果

リサーチクエスチョン

  • RQ1クォータニオンニューラルネットワークは、メルエネルギーとその微分などの多次元音響特徴内の内部依存関係を、実数値ネットワークよりも効果的にモデル化できるか?
  • RQ2CNNおよびRNNにクォータニオン代数を適用することで、TIMITベンチマークにおける発音認識精度が向上するか?
  • RQ3QNNsは、実数値同等品と比較して、性能を維持または向上させながら、どれほど多くの学習可能なパラメータを削減できるか?
  • RQ4QNNsにおけるパラメータ数の削減は、音声認識タスクにおけるより優れた一般化性能と過学習の低減に寄与するか?

主な発見

  • QCNNはTIMITテストセットで19.5%の発音誤り率(PER)を達成し、実数値CNNの20.6%を上回り、顕著に少ないパラメータ数で実現した。
  • QRNNはテストセットで18.5%のPERを達成し、実数値RNNの19.0%を上回り、優れた性能と一般化能力を示した。
  • QRNNのパラメータ数は380万で、同等のRNNの940万に比べ、同じ隠れ次元に対して2.47倍の削減を達成した。
  • すべての実験において、最大で3.96倍のパラメータ削減が達成され、QNNによる顕著な効率性向上を示した。
  • QRNNは自由パラメータ数が少ないため、より大きな隠れ次元でも過学習の兆候が顕著に少なかった。
  • 結果から、クォータニオンネットワークが、実数値モデルよりも内部特徴関係とフレーム間依存関係の両方をより効果的に学習でき、より表現力があり、コンパクトな表現を可能にすることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。