Skip to main content
QUICK REVIEW

[論文レビュー] How random are a learner's mistakes?

Joel Ratsaby|arXiv (Cornell University)|Mar 21, 2009
Machine Learning and Algorithms参考文献 3被引用数 4
ひとこと要約

本稿は、高階マルコフ源(順序 $k^*$)から生成されたデータに対して、順序 $k$ のマルコフモデルを用いた学習者が行う予測誤差のランダム性を分析する。大偏差境界を導出し、予測 '0' の誤差頻度が、ビット '1' の真の定常確率 $\beta$ に収束することを示し、収束速度は $k$、$m$(訓練サイズ)、$\nu$(0予測回数)に依存することを明らかにした。これにより、誤差バイアスに対する確率的制御が可能となる。

ABSTRACT

Given a random binary sequence $X^{(n)}$ of random variables, $X_{t},$ $t=1,2,...,n$, for instance, one that is generated by a Markov source (teacher) of order $k^{*}$ (each state represented by $k^{*}$ bits). Assume that the probability of the event $X_{t}=1$ is constant and denote it by $β$. Consider a learner which is based on a parametric model, for instance a Markov model of order $k$, who trains on a sequence $x^{(m)}$ which is randomly drawn by the teacher. Test the learner's performance by giving it a sequence $x^{(n)}$ (generated by the teacher) and check its predictions on every bit of $x^{(n)}.$ An error occurs at time $t$ if the learner's prediction $Y_{t}$ differs from the true bit value $X_{t}$. Denote by $ξ^{(n)}$ the sequence of errors where the error bit $ξ_{t}$ at time $t$ equals 1 or 0 according to whether the event of an error occurs or not, respectively. Consider the subsequence $ξ^{(ν)}$ of $ξ^{(n)}$ which corresponds to the errors of predicting a 0, i.e., $ξ^{(ν)}$ consists of the bits of $ξ^{(n)}$ only at times $t$ such that $Y_{t}=0.$ In this paper we compute an estimate on the deviation of the frequency of 1s of $ξ^{(ν)}$ from $β$. The result shows that the level of randomness of $ξ^{(ν)}$ decreases relative to an increase in the complexity of the learner.

研究の動機と目的

  • パラメトリックなマルコフモデルを用いて高階マルコフ源からのデータを学習する際の予測誤差の統計的挙動を理解すること。
  • 学習者が '0' を予測するが真のビットが '1' である場合に、誤差系列がどの程度バイアスを受けるかを、真の定常確率 $\beta$ からの逸脱の観点から定量すること。
  • 0予測の部分列における誤差頻度が $\beta$ から著しく逸脱する確率を制御する大偏差境界を導出すること。
  • 学習者が順序 $k$ のモデルを用いるが、真の源は順序 $k^*$ であるというモデル不適合下での誤差頻度の収束保証を確立すること。
  • 確信度レベル $\delta$ を関数として、$k$、$m$、$\nu$、および誤差頻度が $\epsilon$ 以上に $\beta$ から逸脱する確率の高確率バウンドを提供すること。

提案手法

  • 予測誤差を二値列 $\xi^{(n)}$ としてモデル化し、$\xi_t = 1$ が予測 $y_t \neq x_{m+t}$ のときに成立する。特に、$y_t = 0$ である予測に対応する部分列 $\xi^{(\nu)}$ に注目する。
  • 部分列 $\xi^{(\nu)}$ における誤差頻度を $\|\Xi^{(\nu)}\| / \nu$ と定義し、ここで $\|\Xi^{(\nu)}\|$ は0予測における誤差数(すなわち、真のビットが '1' に等しい回数)を数える。
  • 大偏差理論を用いて、この頻度が真の定常確率 $\beta = \mathbb{P}(X_t = 1)$ から $\epsilon$ 以上逸脱する確率を指数的尾部バウンドで制御する。
  • 確率的期待値のバウンドを導くために、確率的遷移行列 $M$ と対角行列 $D_t^2$ を用いた行列解析的手法を適用し、二重線形形式の表現を得る。
  • モデルパラメータ推定値の上での確率を分解し、濃縮不等式を用いることで、$\mathbb{P}(E_{\hat{d},\epsilon}^{(\ell)})$、すなわち0予測部分列における誤差頻度が $\beta$ から $\epsilon$ 以上逸脱する確率のバウンドを導出する。
  • モデル推定誤差($\overline{A}_r^{(k)}$ を通じて)と誤差頻度逸脱($E_{d,\epsilon}^{(\ell)}$ を通じて)のバウンドを組み合わせ、$k$、$m$、$\ell$、$\delta$ の関数として $\epsilon$ に対する最終的な高確率バウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1予測 '0' の誤差頻度が、データ内におけるビット '1' の真の定常確率 $\beta$ から著しく逸脱する確率はどの程度か?
  • RQ20予測における誤差頻度の $\beta$ への収束速度は何か? そして、モデル順序 $k$、訓練サイズ $m$、0予測回数 $\nu$ にどのように依存するか?
  • RQ3学習者が順序 $k$ のモデルを用いるが、真の源は順序 $k^*$ である場合に、誤差頻度が $\beta$ から逸脱する確率に対して高確率バウンドを提供できるか?
  • RQ4学習者のパラメータ推定誤差は、誤差系列 $\xi^{(\nu)}$ のバイアスにどのように影響するか?
  • RQ5誤差頻度が $\epsilon$ 以内に $\beta$ に収束する確率が $1 - \delta$ 以上であるように保証するための最小の標本サイズ $m$ および 0予測回数 $\nu$ は何か?

主な発見

  • 本稿では、0予測における誤差頻度が $\beta$ から $\epsilon$ 以上逸脱する確率が、$2|A_r^{(k)}|\exp\{-2\ell\gamma\epsilon^2\} + \exp\{-2^{k-2}(r/2^k - \rho^{(m)})^2\}$ で抑えられることを示した。ここで $\ell$ は0予測の最小数を表す。
  • 任意の $\delta > 0$ に対して、逸脱量 $\epsilon$ は次のように上界で抑えられる: \\n$$ \sqrt{\frac{1}{2\ell\gamma}\left(2^k\left(\sqrt{\frac{1}{2^{k-2}}\ln(2/\delta)} + \rho^{(m)}\right)\ln\left(\frac{e}{\sqrt{1/2^{k-2}\ln(2/\delta)} + \rho^{(m)}}\right) + \ln 2 + \ln(4/\delta)\right)} $$ この不等式は確率 $1 - \delta$ 以上で成り立つ。
  • 誤差頻度の $\beta$ への収束速度は、$\ell$(0予測回数)とパラメータ $\gamma = \frac{1 - \lambda_0}{1 + \lambda_0}$ に依存し、ここで $\lambda_0$ は遷移行列の2番目に大きな固有値である。
  • 誤差頻度逸脱のバウンドは、学習者のモデルパラメータが長さ $m$ の訓練系列から推定され、パラメータ推定誤差が測度濃縮によって制御されるという仮定の下で導出された。
  • 導出されたバウンドにより、$m$ が十分に大きくかつ $\ell$ が十分に大きい場合、モデル推定誤差と誤差頻度逸脱の両方が同時に小さくなる確率が高くなることが保証される。
  • この結果は、学習者が $k < k^*$ である不適合モデルを用いても、十分なデータが得られていれば、0予測からの誤差系列が高確率で真の $\beta$ に確率的に近いままであることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。