Skip to main content
QUICK REVIEW

[論文レビュー] Learning from many trajectories

Stephen Tu, Roy Frostig|arXiv (Cornell University)|Mar 31, 2022
Machine Learning and Algorithms被引用数 9
ひとこと要約

本稿は、相関する共変量の複数の独立した系列(軌道)からの教師あり学習を研究し、軌道数 $ m $ が入力次元 $ n $ を超えると、線形最小二乗回帰の最悪ケース誤差率が $ \Theta(n/mT) $ にスケーリングすることを示している。これは、$ mT $ 個の独立同一分布の例からの学習のレートと一致する。これは、$ m \gtrsim n $ の点で、逐次的依存性が性能を低下させない明確な統計的効率の遷移を示している。

ABSTRACT

We initiate a study of supervised learning from many independent sequences ("trajectories") of non-independent covariates, reflecting tasks in sequence modeling, control, and reinforcement learning. Conceptually, our multi-trajectory setup sits between two traditional settings in statistical learning theory: learning from independent examples and learning from a single auto-correlated sequence. Our conditions for efficient learning generalize the former setting--trajectories must be non-degenerate in ways that extend standard requirements for independent examples. Notably, we do not require that trajectories be ergodic, long, nor strictly stable. For linear least-squares regression, given $n$-dimensional examples produced by $m$ trajectories, each of length $T$, we observe a notable change in statistical efficiency as the number of trajectories increases from a few (namely $m \lesssim n$) to many (namely $m \gtrsim n$). Specifically, we establish that the worst-case error rate of this problem is $Θ(n / m T)$ whenever $m \gtrsim n$. Meanwhile, when $m \lesssim n$, we establish a (sharp) lower bound of $Ω(n^2 / m^2 T)$ on the worst-case error rate, realized by a simple, marginally unstable linear dynamical system. A key upshot is that, in domains where trajectories regularly reset, the error rate eventually behaves as if all of the examples were independent, drawn from their marginals. As a corollary of our analysis, we also improve guarantees for the linear system identification problem.

研究の動機と目的

  • i.i.d. 学習と単一系列学習の中間的な設定として、相関する共変量の複数の独立した系列(軌道)からの学習の統計的効率を理解すること。
  • 共変量が $ n $ 次元で、各軌道の長さが $ T $ の $ m $ 個の軌道からデータが生成される場合、通常最小二乗回帰の最悪ケース誤差率を特徴づけること。
  • 軌道数 $ m $ が入力次元 $ n $ に対して十分に大きくなる臨界的領域を特定し、そのとき統計的効率が独立例からの学習と一致することを明らかにすること。
  • リスクの鋭い上界と下界を確立し、$ m \gtrsim n $ の点で学習効率に段階的転移が生じることを明らかにすること。これは、エルゴード性や長時間ホライズンの仮定がなくても成立する。
  • 多軌道構造を活用することで、線形システム同定の一般化保証を改善すること。

提案手法

  • $ m $ 個の独立した系列(軌道)が、長さ $ T $ の確率的過程から生成される多軌道学習フレームワークを提案する。各共変量はノイズ付きの線形ラベルとペアになる。
  • 統計的同定可能性と軌道の非退化性を保証するための主要仮定として、「軌道小球条件」を導入し、i.i.d. 条件を一般化する。
  • 共変量過程に線形動的システム(LDS)モデルを適用し、状態遷移 $ x_t = A x_{t-1} + B w_t $ とラベル $ y_t = W_* x_t + \xi_t $ を仮定する。
  • Gram行列の固有値解析と集中不等式を用いて、特に軌道の共分散 $ \Theta_{1,T,T} $ の構造に注目し、予測リスクの高確率上界を導出する。
  • 一部の不安定なLDS例を用いて下界を確立し、$ m \lesssim n $ のとき誤差率が $ \Omega(n^2 / m^2 T) $ に低下することを示し、段階的転移を強調する。
  • 少数の軌道における下界を導出するため、ブロックデコヒーレンスと三重対角行列の固有値解析を用い、$ m \gtrsim n $ でなければ依存性を完全に相殺できないことを示す。

実験結果

リサーチクエスチョン

  • RQ1$ n $ 次元の共変量を持つ長さ $ T $ の $ m $ 個の軌道から学習する際、通常最小二乗回帰の最悪ケース誤差率は何か?
  • RQ2軌道数 $ m $ が入力次元 $ n $ に対して増加する際、特に $ m \lesssim n $ と $ m \gtrsim n $ の領域で誤差率はどのように変化するか?
  • RQ3多くの短い依存的軌道からの学習の統計的効率は、周辺分布から得た $ mT $ 個の独立例からの学習と一致することができるか?
  • RQ4どのような軌道生成過程の条件(例えば、線形動的システム)が、誤差率が $ \Theta(n/mT) $ にスケーリングすることを保証するか?また、このレートはいつ到達不能となるか?
  • RQ5少数の軌道における状況($ m \lesssim n $)ではリスクはどのように振る舞い、このような設定における性能の根本的限界は何か?

主な発見

  • $ m \gtrsim n $ のとき、長さ $ T $ の $ m $ 個の軌道からの線形最小二乗回帰の最悪ケースリスクは $ \Theta(n/mT) $ に達し、$ mT $ 個のi.i.d.例からの学習と同一のレートを示す。
  • 少数の軌道における状況($ m \lesssim n $)では、最悪ケースリスクは $ \Omega(n^2 / m^2 T) $ に低下し、これはわずかに不安定な線形動的システムによって達成され、依存性に起因する根本的劣化を示している。
  • $ m \gtrsim n $ の点での遷移は、統計的効率の明確な変化を示しており、この点以降、すべての例が独立であるかのように誤差率が振る舞う。これは、各軌道が強く依存しているにもかかわらず成立する。
  • リスクの上界は、軌道小球条件と経験的Gram行列の集中性を用いて導出され、共分散行列の逆行列に対する高確率的制御が行われている。
  • 下界はタイトであり、特定の線形動的システム(ほぼ不安定な固有値を有する)を用いて構築されており、$ \Omega(n^2 / m^2 T) $ のレートが少数の軌道における状況で避けられないことを示している。
  • 補足として、本稿は線形システム同定の一般化保証を改善し、軌道数 $ m $ が推定精度に重要な役割を果たすことを示している。$ m \gtrsim n $ であることが最適スケーリングを達成するための必要条件である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。