Skip to main content
QUICK REVIEW

[論文レビュー] Differentiable Weighted Finite-State Transducers

Awni Hannun, Vineel Pratap|arXiv (Cornell University)|Oct 2, 2020
Topic Modeling参考文献 38被引用数 10
ひとこと要約

本稿では、重み付き有限状態トランスダクサ(WFST)の微分可能フレームワークを導入し、深層学習パイプラインにWFST操作を統合することで、構造化された系列モデルのエンドツーエンド学習を可能にする。自動微分をサポートすることで、損失関数、潜在変数モデリング(例:ワードピec分 解)、および新しいレイヤー(例:畳み込みWFSTレイヤー)の共同最適化が可能となり、パラメータ数を減らしながら精度が向上し、音声認識および筆跡認識タスクで検証された。

ABSTRACT

We introduce a framework for automatic differentiation with weighted finite-state transducers (WFSTs) allowing them to be used dynamically at training time. Through the separation of graphs from operations on graphs, this framework enables the exploration of new structured loss functions which in turn eases the encoding of prior knowledge into learning algorithms. We show how the framework can combine pruning and back-off in transition models with various sequence-level loss functions. We also show how to learn over the latent decomposition of phrases into word pieces. Finally, to demonstrate that WFSTs can be used in the interior of a deep neural network, we propose a convolutional WFST layer which maps lower-level representations to higher-level representations and can be used as a drop-in replacement for a traditional convolution. We validate these algorithms with experiments in handwriting recognition and speech recognition.

研究の動機と目的

  • モデル学習中に使用可能な微分可能WFSTを提供し、推論における静的WFST使用の制限を克服すること。
  • 構造化された系列レベル損失関数(例:CTC、ASG)を、手動で実装された代替手法よりも柔軟に、グラフ操作を介して表現・最適化できること。
  • 訓練中に潜在的分解を周辺化することで、タスク固有のワードピec分解を学習し、モデルの適応性を向上させること。
  • WFSTを深層ニューラルネットワーク内の学習可能なレイヤーとして統合し、従来の畳み込みレイヤーを置き換えたり、補完したりすること。
  • 微分可能WFSTが、パラメータ数と計算コストを削減しながらも、音声および筆跡認識タスクでモデル精度を向上させることを実証すること。

提案手法

  • WFSTの構造と操作を分離し、WFST合成、インターセクション、前方スコアリングの各操作に対して自動微分を可能にする。
  • 系列レベル損失関数(例:ASG、CTC)をグラフ操作として表現:制約付きグラフと正規化グラフの前方スコアの差分により損失を計算する。
  • スケーリングのための大規模語彙への対応を実現するため、プルーニングおよびバックオフを備えた遷移WFSTを用いる。
  • 訓練中に可能なサブワードユニットの周辺化をWFSTを用いて潜在的ワードピec分解をモデリングし、タスク固有のサブワードユニットを学習可能にする。
  • 下位の表現(例:文字)を上位の表現(例:ワードピec)にマッピングする学習可能な変換ルールを持つ畳み込みWFSTレイヤーを設計する。
  • 微分可能WFST操作を通じたバックプロパゲーションにより、フレームワークのC++およびPythonフロントエンドを介して勾配を計算し、モデル全体をエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1重み付き有限状態トランスダクサ(WFST)を微分可能にすることで、深層学習モデルにおけるエンドツーエンド学習を可能にできるか?
  • RQ2微分可能WFSTは、手動実装の代替手法よりも柔軟に、新しい構造化された系列レベル損失関数を表現・最適化できるか?
  • RQ3WFSTベースの周辺化を用いて、訓練中に動的に潜在的ワードピec分解を学習できるか?大規模語彙タスクでの性能向上が見られるか?
  • RQ4WFSTを深層ニューラルネットワーク内の学習可能なレイヤーとして使用できるか?従来の畳み込みレイヤーを置き換えたり、上回る性能を発揮できるか?
  • RQ5微分可能WFSTの統合により、音声および筆跡認識タスクでモデル精度が向上し、モデルの複雑さが低減するか?

主な発見

  • 微分可能WFSTフレームワークにより、ASG や CTC といった構造化された損失関数が、グラフ操作と自動微分を介してエンドツーエンド学習が可能になった。
  • 潜在的ワードピec分解の周辺化により、特に大規模語彙タスクにおいて認識精度が向上し、固定されたサブワードトークン化で失われる性能を回復した。
  • IAM筆跡認識データセットでは、畳み込みWFSTレイヤーがたった2,048パラメータでCER 19.5を達成し、従来の畳み込み(79,000パラメータ、CER 20.7)を上回った。
  • WFST畳み込みレイヤーは、入力チャネル数(ci)ではなくワードピecの長さ(w)に比例してスケーリングされ、従来の畳み込みと比較してパラメータ数と演算数の両方を削減した。
  • モデルは入力ごとに最適なワードピec分解を選択し、密な筆跡では高レベルのトークンを好むなど、適応的表現学習を示した。
  • 実験により、微分可能WFSTが、データとグラフにエンコードされた事前知識を共同最適化可能にし、一般化性能を向上させるとともに露出バイアスを低減できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。