Skip to main content
QUICK REVIEW

[論文レビュー] Distributionally Robust Groupwise Regularization Estimator

José Blanchet, Yang Kang|arXiv (Cornell University)|May 11, 2017
Distributed Sensor Networks and Detection Algorithms被引用数 6
ひとこと要約

本稿では、グループ平方根lasso(GSRL)推定量の分布的ロバスト最適化(DRO)フレームワークを導入し、正則化を学習者とデータ分布を摂動する敵対的対立のゲームとして解釈する。交差検証を繰り返し調整せずに、交差検証性能を同等または上回る、データ駆動型で漸近的に有効な正則化パラメータの公式を導出する。

ABSTRACT

Regularized estimators in the context of group variables have been applied successfully in model and feature selection in order to preserve interpretability. We formulate a Distributionally Robust Optimization (DRO) problem which recovers popular estimators, such as Group Square Root Lasso (GSRL). Our DRO formulation allows us to interpret GSRL as a game, in which we learn a regression parameter while an adversary chooses a perturbation of the data. We wish to pick the parameter to minimize the expected loss under any plausible model chosen by the adversary - who, on the other hand, wishes to increase the expected loss. The regularization parameter turns out to be precisely determined by the amount of perturbation on the training data allowed by the adversary. In this paper, we introduce a data-driven (statistical) criterion for the optimal choice of regularization, which we evaluate asymptotically, in closed form, as the size of the training set increases. Our easy-to-evaluate regularization formula is compared against cross-validation, showing good (sometimes superior) performance.

研究の動機と目的

  • グループ平方根lasso(GSRL)推定量の分布的ロバスト最適化(DRO)解釈を提供し、解釈可能性と統計的洞察を向上させること。
  • 交差検証に依存せず、計算コストの高い反復的チューニングを必要としない、GSRLにおける正則化パラメータの選択のためのデータ駆動型で漸近的に有効な基準を開発すること。
  • 学習者が経験分布の敵対的摂動下での最悪ケース期待損失を最小化するゲーム理論的解釈を確立すること。
  • 提案された正則化パラメータ選択手法を線形回帰およびロジスティック回帰の設定で実証的に評価し、交差検証と性能を比較すること。
  • DROフレームワークをグループワイド正則化に拡張し、変数選択におけるグループ構造を保ちながら、分布シフトに対してロバストな性能を実現すること。

提案手法

  • 経験分布の近傍にある分布の集合(不一致ボール)上での最悪ケース期待損失を最小化する問題としてGSRLをDRO問題として定式化する。
  • 最適輸送を用いて不一致測度を定義し、経験分布に対する許容可能な最大摂動を定量化する。正則化パラメータはこのボールのサイズと関連付ける。
  • DRO定式化に基づき、経験分布とグループ構造を用いて、最適正則化パラメータの閉形式で得られる漸近的有効な公式を導出する。
  • 線形回帰とロジスティック回帰の両方の設定にDROフレームワークを適用し、それぞれ平方損失関数と対数指数損失関数を用い、α-(2,1)ノルムによるグループワイド正則化を実施する。
  • 合成データ(n=50, 100, 500, 1000)とUCI乳癌データセットを用いて、訓練誤差とテスト誤差を比較して実証的妥当性を検証する。
  • ゲーム理論的解釈を適用:学習者は最悪ケース損失を最小化する回帰パラメータを選択し、敵対的対立者は不一致集合内での最悪ケース分布を選択して損失を最大化する。

実験結果

リサーチクエスチョン

  • RQ1グループ平方根lasso(GSRL)推定量は、どのように分布的ロバスト最適化(DRO)フレームワークによって解釈できるか?
  • RQ2GSRLにおける正則化パラメータの統計的・ゲーム理論的解釈は何か?また、分布の不確実性とどのように関連しているか?
  • RQ3DRO定式化から、交差検証を回避するデータ駆動型で漸近的に有効な正則化パラメータの公式を導出できるか?
  • RQ4提案された正則化パラメータ選択手法は、予測性能と計算効率の面で交差検証と比べてどのように異なるか?
  • RQ5DROフレームワークは、線形回帰およびロジスティック回帰における他のグループワイド正則化推定量へ、どの程度拡張可能か?

主な発見

  • 提案されたDRO定式化により、学習者がデータ分布の敵対的摂動下での最悪ケース損失を最小化するゲーム理論的解釈が得られる。
  • GSRLにおける正則化パラメータは、経験分布に対する許容可能な最大摂動(不一致)によって正確に定義され、分布的ロバストネスと直接関連づけられる。
  • 導出された正則化パラメータの漸近的公式は計算が効率的であり、交差検証に必要なデータ分割を回避し、すべての訓練データをモデル推定に使用できる。
  • 線形回帰のシミュレーションでは、提案手法(RWPI GSRL)はn=1000でテスト誤差4.11±0.26を達成し、交差検証(訓練時3.95±0.19、テスト時4.11±0.26)と同等の性能を示したが、著しく低い計算コストであった。
  • ロジスティック回帰では、RWPI GSRLはn=1000でテスト対数指数損失0.488±0.017を達成し、交差検証(0.488±0.019)と同等またはわずかに優れた性能を示し、569サンプルのUCI乳癌データセットでも良好な性能を示した。
  • UCI乳癌データセットでは、RWPI GSRLはテスト損失0.240±0.098を達成し、交差検証(0.213±0.041)と同等の性能を示し、小標本サイズでもロバストであることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。