Skip to main content
QUICK REVIEW

[論文レビュー] Few-shot learning with attention-based sequence-to-sequence models

Bertrand Higy, Peter Bell|arXiv (Cornell University)|Nov 8, 2018
Domain Adaptation and Few-Shot Learning参考文献 20被引用数 7
ひとこと要約

本稿では、低リソースで小規模な語彙を持つ環境における少数ショットキーワード認識に、アテンションベースのシーケンス・ツー・シーケンスモデルの使用を提案する。本手法は、10個の少々ショット例を用いて、高速な適応戦略を採用し、68.8%の精度を達成しており、再訓練を上回り、アクセス可能でエンド・トゥ・エンドの音声コマンドシステムの強力な可能性を示している。

ABSTRACT

End-to-end approaches have recently become popular as a means of simplifying the training and deployment of speech recognition systems. However, they often require large amounts of data to perform well on large vocabulary tasks. With the aim of making end-to-end approaches usable by a broader range of researchers, we explore the potential to use end-to-end methods in small vocabulary contexts where smaller datasets may be used. A significant drawback of small-vocabulary systems is the difficulty of expanding the vocabulary beyond the original training samples -- therefore we also study strategies to extend the vocabulary with only few examples per new class (few-shot learning). Our results show that an attention-based encoder-decoder can be competitive against a strong baseline on a small vocabulary keyword classification task, reaching 97.5% of accuracy on Tensorflow's Speech Commands dataset. It also shows promising results on the few-shot learning problem where a simple strategy achieved 68.8\% of accuracy on new keywords with only 10 examples for each new class. This score goes up to 88.4\% with a larger set of 100 examples.

研究の動機と目的

  • エンド・トゥ・エンドのアテンションベースのシーケンス・ツー・シーケンスモデルが小規模語彙のキーワード認識タスクに適しているかを評価すること。
  • 少データシステムにおける語彙の固定という制限を克服し、新しいキーワードに対して少数ショット学習を可能にする。
  • 最小限のデータで新しいクラスにモデルを適応させるための再訓練と微調整戦略を比較すること。
  • 従来のシステムが性能を発揮できない低リソース環境におけるエンド・トゥ・エンドモデルの性能を評価すること。
  • 時間歪みやHMMを用いずに、任意長の入力に対応できるシーケンス・ツー・シーケンスモデルをキーワード検出に使用する可能性を検討すること。

提案手法

  • 生の音声を入力とし、発音記号または表音記号のシーケンスを出力とするエンド・トゥ・エンドの音声認識に、加法的アテンションを用いたエンコーダ・デコーダアーキテクチャを採用する。
  • Tensorflow Speech Commandsデータセットからの固定長の音声クリップを用いて、交差エントロピー損失でモデルを訓練する。
  • 2つの少数ショット学習戦略を実装する:(1) 拡張された新しいキーワード例を用いて再訓練から始めること、(2) 初期の学習率を低くした上で、事前学習済みモデルを新しいクラスで微調整すること。
  • 訓練中のクラス頻度のバランスを取るために、新しいキーワードを最大3000例までオーバーサンプリングによるデータ拡張を実施する。
  • 訓練の安定化と入力・出力シーケンス間のアライメント向上のため、ハイブリッドCTC/アテンション機構を採用する。
  • 分類誤差を用いて、オリジナルの未知のキーワードおよび新しいキーワードの性能を評価し、結果を10回のランダム実行の平均値として算出することでばらつきを低減する。

実験結果

リサーチクエスチョン

  • RQ1強力なDNN-HMMベースラインと比較して、エンド・トゥ・エンドのアテンションベースのシーケンス・ツー・シーケンスモデルは、小規模語彙のキーワード認識タスクで競争力のある性能を達成できるか?
  • RQ2新しいクラスに10例または100例のデータしか利用できない状況で、単純な再訓練戦略は少数ショットキーワード学習にどの程度有効か?
  • RQ3少ないデータでのキーワード認識において、高速な微調整(適応)戦略は再訓練を上回る精度と訓練効率を達成できるか?
  • RQ4微調整による適応が進むにつれて、オリジナルキーワードの性能はどの程度低下するか?
  • RQ5限られたデータにおける少数ショット学習性能に、発音記号と表音記号の出力表現の選択が与える影響は何か?

主な発見

  • アテンションベースのシーケンス・ツー・シーケンスモデルは、オリジナルのSpeech Commandsデータセットで97.5%の精度を達成し、強力なDNN-HMMベースラインを上回った。
  • 再訓練戦略では、クラスあたり10例で40.5%の精度、100例で81.5%の精度に達し、低データ環境下でも実現可能であることが示された。
  • 微調整(適応)戦略では、10例で68.8%、100例で88.4%の精度を達成し、再訓練を大きく上回りながらも、はるかに高速に訓練可能であった。
  • 適応過程での学習率の上昇に伴い、オリジナルキーワードの性能が低下し、過学習が発生した際に急激に精度が低下した。
  • 適応戦略における発音記号または表音記号の置換ルールの使用は、新しいキーワードの性能に悪影響を及げず、出力表現の選択に対して頑健であることが示された。
  • ハイブリッドCTC/アテンション機構は、大規模語彙のASRとは異なり、小規模語彙タスクにおいて異なる訓練ダイナミクスを示し、低リソース環境下での特異な挙動を示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。