Skip to main content
QUICK REVIEW

[論文レビュー] Minimizers of the Empirical Risk and Risk Monotonicity

Marco Loog, Tom J. Viering|arXiv (Cornell University)|Jul 11, 2019
Machine Learning and Data Classification参考文献 35被引用数 7
ひとこと要約

この論文は、リスク単調性の形式的概念を導入し、それが訓練データサイズが増加しても期待リスクが増加しないという性質であると定義している。多くの標準的な経験的リスク最小化手法(分類、回帰、密度推定の分野を含む)が、任意に大きな標本サイズであっても非単調な学習曲線を示すことがあることが示され、期待的により多くのデータが性能を向上させるという広く共有されている仮定に疑問を呈している。

ABSTRACT

Plotting a learner's average performance against the number of training samples results in a learning curve. Studying such curves on one or more data sets is a way to get to a better understanding of the generalization properties of this learner. The behavior of learning curves is, however, not very well understood and can display (for most researchers) quite unexpected behavior. Our work introduces the formal notion of \emph{risk monotonicity}, which asks the risk to not deteriorate with increasing training set sizes in expectation over the training samples. We then present the surprising result that various standard learners, specifically those that minimize the empirical risk, can act \emph{non}monotonically irrespective of the training sample size. We provide a theoretical underpinning for specific instantiations from classification, regression, and density estimation. Altogether, the proposed monotonicity notion opens up a whole new direction of research.

研究の動機と目的

  • 訓練データが増えるにつれて学習性能が向上する、あるいは少なくとも劣化しないという直感的な期待を形式化すること。
  • 学習曲線が単調に減少するとされる一般的な仮定に反して、標準的な学習設定における反例を提示することで、その仮定に疑問を呈すること。
  • 教師あり学習における一般化行動の新たな性質として、リスク単調性の理論的基盤を確立すること。
  • 経験的リスク最小化(ERM)学習者が、訓練サンプルの期待値において非単調な振る舞いを示す可能性があるかどうかを調査すること。
  • 非単調性がモデル選択、データ収集、一般化の理論的理解に与える影響を検討すること。

提案手法

  • リスク単調性を形式的基準として提唱:訓練データサイズが増加するにつれて期待リスクが増加してはならない。
  • 分類、回帰、密度推定における経験的リスク最小化者を、理論的導出と不等式を用いて分析する。
  • 記憶型学習者に基づく反例を用いて、VC次元が無限大であっても非単調性が生じ得ることを示す。
  • 損失比に基づく非単調性の条件を導出:損失の減少率が n/(n+1) 未満の場合、非単調性が生じる。
  • 学習理論の結果(例えば、アグノスティック学習者における √(n/(n+1)) の収束レート)を応用し、単調性の可能性を評価する。
  • 理論的解析が困難なケースについて実験的検証を提供し、理論的発見を裏付ける。

実験結果

リサーチクエスチョン

  • RQ1経験的リスク最小化手法は、任意に大きな訓練データセットをもつ場合でも、期待的に非単調な学習曲線を示す可能性があるか?
  • RQ2損失関数や学習アルゴリズムにどのような条件が満たされると、データが増加しても非単調なリスク行動が生じるのか?
  • RQ3リスク単調性はPAC学習可能性とどのように関係するか?PAC学習可能であるが非単調な学習者は存在するか?
  • RQ4特定の損失関数や正則化戦略は、ERMにおけるリスク単調性を強制できるか?
  • RQ5学習曲線の形状は、元の分布の性質からどの程度予測可能か?

主な発見

  • 分類、回帰、密度推定における経験的リスク最小化手法は、大規模な標本サイズであっても期待リスクにおいて非単調な振る舞いを示す可能性がある。
  • 非単調性の条件は損失の比として導出され、1サンプルあたりの損失の減少率が n/(n+1) 未満の場合、非単調性が生じる。
  • VC次元が無限大である記憶型学習者もリスク単調性を満たすことが示され、単調性がPAC学習可能性を意味するわけではないことが明らかになった。
  • 理論的分析により、収束レートが √(n/(n+1)) のアグノスティック学習者でさえも非単調性を示す可能性があることが判明した。これは、すべての有限な n に対してこのレートが n/(n+1) を上回るためである。
  • この研究は、非単調性が有限サンプルや不良な実験設計の結果ではなく、ある種のERM手順の根本的性質であることを明らかにした。
  • 結果として、リスク単調性はPAC学習可能性とは別個の、かつあまり注目されていない性質であり、モデル評価やデータ収集に影響を与える可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。