Skip to main content
QUICK REVIEW

[論文レビュー] Leave Zero Out: Towards a No-Cross-Validation Approach for Model Selection

Weikai Li, Chuanxing Geng|arXiv (Cornell University)|Dec 24, 2020
Machine Learning and Algorithms参考文献 69被引用数 9
ひとこと要約

本稿では、データホールドアウトを回避するためのデータ拡張を用いて安価で理論的裏付けのある検証セットを生成する、新しいモデル選択手法Leave-Zero-Out (LZO) を提案する。従来の交差検証とは異なり、LZOは全データセットに対して一度のモデル学習で済ませ、計算コストを著しく削減しながらも、同等またはより高い精度を達成する。特に小規模データや半教師あり学習の設定において顕著な利点を示す。

ABSTRACT

As the main workhorse for model selection, Cross Validation (CV) has achieved an empirical success due to its simplicity and intuitiveness. However, despite its ubiquitous role, CV often falls into the following notorious dilemmas. On the one hand, for small data cases, CV suffers a conservatively biased estimation, since some part of the limited data has to hold out for validation. On the other hand, for large data cases, CV tends to be extremely cumbersome, e.g., intolerant time-consuming, due to the repeated training procedures. Naturally, a straightforward ambition for CV is to validate the models with far less computational cost, while making full use of the entire given data-set for training. Thus, instead of holding out the given data, a cheap and theoretically guaranteed auxiliary/augmented validation is derived strategically in this paper. Such an embarrassingly simple strategy only needs to train models on the entire given data-set once, making the model-selection considerably efficient. In addition, the proposed validation approach is suitable for a wide range of learning settings due to the independence of both augmentation and out-of-sample estimation on learning process. In the end, we demonstrate the accuracy and computational benefits of our proposed method by extensive evaluation on multiple data-sets, models and tasks.

研究の動機と目的

  • 従来の交差検証における計算効率の低さとバイアスの問題を解決すること、特に小規模データおよび大規模データの両方の状況において。
  • 学習と評価を同じデータで行うための過学習に陥りやすい、モデルに依存する近似交差検証手法の限界を克服すること。
  • データホールドアウトを回避しながら、全訓練データを最大限に活用する、普遍的かつ計算効率が良く、理論的根拠のあるバリデーション戦略を開発すること。
  • ラベル付きデータが限られた半教師あり学習のような困難な設定でも、効果的なモデル選択を可能にすること。
  • 繰り返しモデル再学習を必要とせずに、一般化誤差の理論的境界付き推定を提供すること。

提案手法

  • 元の訓練データからデータ拡張を用いて補助的バリデーションセットを構築し、いかなるデータホールドアウトも行わない。
  • 真のリスクと拡張されたバリデーションリスクの推定バイアスを理論的に束縛するために、Jansen-Shannon (JS) 発散を用いる。
  • 一般化誤差推定誤差の上界を、元のデータ分布と拡張データ分布の間のJS発散およびバリデーションセットのサンプルサイズに依存する形で導出する。
  • 最終モデルを拡張データ上で直接評価することで、バリデーション推定を最もバイアスの少ないものに保証する。
  • 拡張と学習の独立性を活用し、さまざまな学習モデルや設定に適用可能な方法とする。
  • 標準的な交差検証で一般的に見られる繰り返しモデル再学習を排除し、一度の学習パスで手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1データホールドアウトを回避しながらも、交差検証と同等またはそれ以上の推定精度を達成できるモデル選択手法を開発することは可能か?
  • RQ2全利用可能な訓練データを完全に活用する、計算的に効率の良いモデル選択戦略を実現することは可能か?
  • RQ3データ分割の代わりにデータ拡張を用いて、理論的境界付きのバリデーション推定を導出することは可能か?
  • RQ4多様な学習設定において、従来の交差検証と比較して、提案手法の精度と効率はどのように評価されるか?
  • RQ5本手法は、低データまたは半教師あり学習の状況において特に優れた利点を示すか?

主な発見

  • LZOは20の教師あり学習データセットにおいて、従来の交差検証と同等またはそれ以上の精度を達成しながら、計算コストを著しく削減した。
  • 6つの半教師あり学習データセットにおいて、LZOは交差検証を大きく上回る顕著な精度向上を示し、低データ環境下での優位性を裏付けた。
  • 本手法は、全データセットに対して一度のモデル学習パスで実行可能であり、標準的な交差検証と比べて桁違いに高速である。
  • 理論的分析により、推定誤差が元のデータ分布と拡張データ分布の間のJS発散によって束縛されることを示し、原理的根拠を提供した。
  • 学習アルゴリズムに依存しない性質のおかげで、異なるモデルタイプや学習設定に普遍的に適用可能である。
  • LZOのコードはGitHub上で公開されており、再現性を確保するとともに、今後の研究における採用を促進する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。