Skip to main content
QUICK REVIEW

[論文レビュー] A deep convolutional neural network that is invariant to time rescaling

Brandon G. Jacques, Zoran Tiganj|arXiv (Cornell University)|Jul 9, 2021
Music and Audio Processing参考文献 25被引用数 4
ひとこと要約

本稿では、時間スケーリングに対して不変性を達成するため、対数圧縮時間記憶を用いる深層畳み込みニューラルネットワーク、SITHConを提案する。時間スケーリングは対数時間における平行移動に変換される。標準的な時空間畳み込みネットワーク(TCNs)とは異なり、再訓練なしに10倍の時間スケーリング範囲にわたって頑健に一般化する。その根拠は、log(at) = log(a) + log(t) という数学的性質に基づく。

ABSTRACT

Human learners can readily understand speech, or a melody, when it is presented slower or faster than usual. Although deep convolutional neural networks (CNNs) are extremely powerful in extracting information from time series, they require explicit training to generalize to different time scales. This paper presents a deep CNN that incorporates a temporal representation inspired by recent findings from neuroscience. In the mammalian brain, time is represented by populations of neurons with temporal receptive fields. Critically, the peaks of the receptive fields form a geometric series, such that the population codes a set of temporal basis functions over log time. Because memory for the recent past is a function of log time, rescaling the input results in translation of the memory. The Scale-Invariant Temporal History Convolution network (SITHCon) builds a convolutional layer over this logarithmically-distributed temporal memory. A max-pool operation results in a network that is invariant to rescalings of time modulo edge effects. We compare performance of SITHCon to a Temporal Convolution Network (TCN). Although both networks can learn classification and regression problems on both univariate and multivariate time series f(t), only SITHCon generalizes to rescalings f(at). This property, inspired by findings from contemporary neuroscience and consistent with findings from cognitive psychology, may enable networks that learn with fewer training examples, fewer weights and that generalize more robustly to out of sample data.

研究の動機と目的

  • 時間スケーリングされた入力に一般化可能な深層ニューラルネットワークアーキテクチャの開発を目的とし、話声やメロディの速度変化に対する人間のような頑健性を再現する。
  • 標準的な時空間畳み込みネットワーク(TCNs)の限界、すなわち線形時間サンプリングのための時間スケーリングにおける一般化不能性を解決することを目的とする。
  • 時間スケーリングを対数時間における平行移動に変換する生物学的インスピレーションを受ける対数圧縮時間記憶を実装し、スケール不変性を実現することを目的とする。
  • 対数的に間隔をあけた時間基底関数の範囲を拡張することで、再訓練なしにスケール不変性を達成できることを示すこと。
  • 深層ネットワークにおける対数時間基底関数の使用の妥当性を検討し、頑健な時間的表現学習を可能にするかを調査すること。

提案手法

  • 核となるイノベーションは、スケール不変時間履歴(SITH)層であり、時間軸上で幾何級数的に間隔をあけたサンプリング点 τ̂_n = (1+c)^(n-1) τ̂_1 を用いることで、対数圧縮を実現する。
  • SITH層は、入力信号 f(t) を基底関数 φ(τ̂_n) と畳み込むことで、時間スケーリングに対して不変な表現 f̃_t[n] を計算する。
  • SITH表現の上に標準的な畳み込み層と全結合層を配置し、出力が対数時間における平行移動に対して等長的(equivariant)であるようにする。
  • 数学的基盤は、log(at) = log(a) + log(t) という恒等式に基づく。これにより、時間スケーリングが対数時間における平行移動に変換され、不変性が実現される。
  • 重みが固定されたまま、τ̂_n の点を追加することで、ネットワークの時間スケールにおける一般化能力が拡張される。
  • 神経生理学的証拠(例:海馬における時間細胞)や知覚におけるウェーバー=フェヒナーの法則に整合する、対数圧縮時間符号化の生物学的インスピレーションに基づく。

実験結果

リサーチクエスチョン

  • RQ1再訓練なしに時間スケーリングされた入力に一般化可能な深層ニューラルネットワークを設計できるか?
  • RQ2時間記憶の対数圧縮が、深層ネットワークにおける時間スケーリング不変性をどのように実現するか?
  • RQ3SITHConは、時間スケーリングを伴う分類および回帰タスクにおいて、標準的なTCNsをどれほど上回るか?
  • RQ4対数的に間隔をあけた基底関数の範囲を拡張することで、指数関数的に大きな時間スケールに一般化できるか?
  • RQ5対数時間基底関数のアプローチは生物学的に妥当であり、既知の神経符号化原理と整合するか?

主な発見

  • SITHConは、単変量および多変量時間系列タスクにおいて、約1桁の時間スケーリング範囲にわたって頑健に一般化するが、標準的なTCNsは同様のスケーリング条件下で一般化に失敗する。
  • SITHConの性能は、広い時間スケーリング範囲にわたって安定しており、テストデータとしての外挿スケーリングでも精度の低下がない。
  • 重みの再学習なしに、単に対数的に間隔をあけたτ̂_nの範囲を拡張するだけで、時間スケーリングに対する不変性を維持できる。
  • 時間記憶の対数圧縮により、時間スケーリングが対数時間における平行移動に変換され、ネットワーク出力が不変のまま保たれる。
  • SITHConは、時間スケーリングを伴うタスクにおいて、TCNsを上回る性能を示し、対数基底関数アプローチがより頑健で一般化可能な時間的表現学習を可能にしていることを示している。
  • 結果は、脳内で観察される対数圧縮時間符号化(例:時間細胞)が、人工ネットワークにおけるスケール不変時間処理の生物学的に妥当なメカニズムであるという仮説を支持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。