Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Kronecker-Sum Approximation of Real Time Recurrent Learning

Frederik Benzing, Marcelo Matheus Gauy|arXiv (Cornell University)|Feb 11, 2019
Machine Learning in Healthcare被引用数 5
ひとこと要約

本稿では、実時間再帰的学習(RTRL)の低分散な新規近似法である最適クリロネッカー和近似(OK)を導入する。OKはクリロネッカーに基づくRTRL近似のクラス内で理論的に最適な性能を達成する。OKはPenn TreeBankベンチマークでTBPTTと同等の性能を示し、合成記憶タスクではそれを上回る。これは、実験的に無視できるほどのノイズと効果的なオンライン学習を示している。

ABSTRACT

One of the central goals of Recurrent Neural Networks (RNNs) is to learn long-term dependencies in sequential data. Nevertheless, the most popular training method, Truncated Backpropagation through Time (TBPTT), categorically forbids learning dependencies beyond the truncation horizon. In contrast, the online training algorithm Real Time Recurrent Learning (RTRL) provides untruncated gradients, with the disadvantage of impractically large computational costs. Recently published approaches reduce these costs by providing noisy approximations of RTRL. We present a new approximation algorithm of RTRL, Optimal Kronecker-Sum Approximation (OK). We prove that OK is optimal for a class of approximations of RTRL, which includes all approaches published so far. Additionally, we show that OK has empirically negligible noise: Unlike previous algorithms it matches TBPTT in a real world task (character-level Penn TreeBank) and can exploit online parameter updates to outperform TBPTT in a synthetic string memorization task. Code availiable on github.

研究の動機と目的

  • 既存のRTRL近似法における高い計算コストとノイズを低減しつつ、非切断勾配計算を維持すること。
  • クリロネッカー和に基づく近似法の中で、理論的に最適なRTRL近似法を考案し、そのクラス内での分散を最小化すること。
  • 提案手法が、実世界および合成タスクにおける実世界の順序付きモデリングタスクでTBPTTと同等またはそれを上回る性能を発揮する、効果的なオンライン学習を可能にすることを実証すること。
  • RTRL勾配に対する不偏で低ランクのクリロネッカー因子近似の理論的限界を調査すること。
  • 標準的なRNN、LSTM、RHNに適用可能な、実用的でメモリおよび実行時間効率の高いRTRL代替手法の可能性を検討すること。

提案手法

  • 低ランク行列のクリロネッカー積の和を用いたRTRL勾配の新規近似を提案し、計算を効率化する。
  • 不偏近似の中で達成可能な最小分散を保証する、クリロネッカー因子の新しいオンライン更新手順を導入する。
  • Eckart-Youngの定理を活用して、Frobeniusノルム誤差を最小化する最適な低ランク近似を構築する。
  • 1バッチ要素あたりの計算コストをTBPTTと同等に保ちつつ、メモリ使用量を低く抑えるために、変種Kronecker-Triple-Product(KTP)を設計する。
  • 理論的分散バウンズとベンチマークタスクにおける実験的比較を通じて、OKおよびKTPの実装と分析を行う。
  • 分散分析と勾配近似品質指標を用いて、異なるネットワークサイズおよび学習段階においてOKの低ノイズ性を検証する。

実験結果

リサーチクエスチョン

  • RQ1不偏近似の中で、分散が理論的に最小となるクリロネッカー和に基づくRTRL勾配近似を構築できるか?
  • RQ2提案された最適クリロネッカー和(OK)近似は、実世界の順序付きモデリングタスクにおいてTBPTTと同等の性能を達成できるか?
  • RQ3OKはオンラインパラメータ更新を活用することで、長期依存関係学習を要するタスクでTBPTTを上回る性能を発揮できるか?
  • RQ4訓練全体にわたり、真のRTRL勾配は低ランククリロネッカー和構造でどれほどよく近似できるか?
  • RQ5OKと比較して、KTPバージョンにおける計算効率と近似ノイズのトレードオフはいかほどか?

主な発見

  • OKは実験的に無視できるほどのノイズを達成し、文字レベルのPenn TreeBankベンチマークでTBPTTと同等の性能を示した。これは、従来のノイズの大きい近似法に比べ顕著な改善である。
  • OKは、オンラインパラメータ更新を効果的に活用することで、合成文字列記憶タスクでTBPTTを上回った。これは、長期依存関係の学習が優れていることを示している。
  • 分散分析の結果、OKは大きなネットワークサイズに対しても低ノイズを維持しており、KF-RTRL-AVGと比較して近似誤差の減少が遅い傾向にあった。
  • OKのバイアス付きバージョン(16-B-OK)は、不偏の16-U-OKとほぼ同等の性能を示しており、真の勾配が16個のクリロネッカー因子の和でよく近似できることを示している。
  • 提案手法はそのクラス内で理論的に最適であり、不偏クリロネッカー和近似における分散を最小化している。
  • KTPは1バッチ要素あたりの実行時間とメモリ使用量をTBPTTと同等に保ったが、ノイズが高く、OKと比較して長いシーケンスでは性能が制限された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。