[論文レビュー] Multivariate Distributionally Robust Convex Regression under Absolute Error Loss
本稿では、経験測度のワサーライン近傍における悪意のある摂動に対する最悪の絶対誤差を最小化する分布的ロバストな凸回帰推定量を提案する。この手法は、勾配に基づく正則化という新規な構造を持つ、解釈可能な線形計画問題に帰着される。この方法は、コンpact領域や関数またはその勾配の事前境界を必要とせず、$ widetilde{O}(n^{-1/d})$ の収束速度を達成し、合成データおよび実世界のデータにおいて既存の推定量を上回る性能を示した。
This paper proposes a novel non-parametric multidimensional convex regression estimator which is designed to be robust to adversarial perturbations in the empirical measure. We minimize over convex functions the maximum (over Wasserstein perturbations of the empirical measure) of the absolute regression errors. The inner maximization is solved in closed form resulting in a regularization penalty involves the norm of the gradient. We show consistency of our estimator and a rate of convergence of order $ \widetilde{O}\left( n^{-1/d} ight) $, matching the bounds of alternative estimators based on square-loss minimization. Contrary to all of the existing results, our convergence rates hold without imposing compactness on the underlying domain and with no a priori bounds on the underlying convex function or its gradient norm.
研究の動機と目的
- 経験測度における悪意のある摂動に対してロバストな非パラメトリックな凸回帰推定量の開発。
- 二乗誤差の代わりに絶対誤差損失を最小化することで、外れ値への感受性を低減。
- 定義域のコンパクト性に関する事前仮定や、凸関数またはその勾配ノルムの境界を不要にする。
- 制限のない仮定のもとで、既存の二乗損失推定量と同等の収束速度を確立する。
- 最小二乗法およびカーネルベースの凸回帰推定量と比較して、実験的に優れた性能を示す。
提案手法
- 経験測度のワサーライン球内での最悪の期待絶対誤差を最小化する分布的ロバスト最適化問題を定式化。
- 応答変数ではなく予測子変数のみを摂動するワサーライン距離を用い、応答の測定誤差を反映。
- 内側の最大化問題を閉形式で解き、推定関数の勾配の$L^1$ノルムに比例する正則化ペナルティを導出。
- 絶対誤差構造のおかげで、標準的な二次計画問題(二乗損失)から計算的に解釈可能な線形計画問題に置き換え。
- 一貫性と最適な収束速度を保証するために、データ駆動型の不確実性半径$\delta_n$を採用。
- 軽尾および重尾の共変量を有する合成データと、実世界の環境排出データセットの両方へ適用。
実験結果
リサーチクエスチョン
- RQ1経験測度における悪意のある摂動に対してロバストであり、定義域がコンパクトでない場合でも動作する凸回帰推定量を開発可能か?
- RQ2絶対誤差損失を最小化することで、二乗誤差最小化と比較してより優れたロバスト性と収束速度が得られるか?
- RQ3関数またはその勾配ノルムに事前境界を設けずに、$\widetilde{O}(n^{-1/d})$ の収束速度を達成可能か?
- RQ4提案手法は、最小二乗法およびカーネルベースの凸回帰手法と比較して、実験的に優れた性能を示すか?
- RQ5重尾の共変量や実世界の応用においても、本手法は強力な性能を維持できるか?
主な発見
- 提案された分布的ロバストな凸回帰推定量は、二乗損失に基づく推定量で最もよく知られたレートと同等の$\widetilde{O}(n^{-1/d})$ の収束速度を達成した。
- 本手法は、元の凸関数やその勾配ノルムに事前境界を必要とせず、定義域がコンパクトであることも不要である。
- 軽尾および重尾の共変量を有する合成実験において、$l_1$および$l_2$損失の両方で、最小二乗法およびカーネルベースの推定量を上回った。
- 最小二乗法の性能はリプシッツ定数$c$の選択に極めて敏感であったが、本手法はそのようなチューニングに対してロバストであった。
- 実世界の環境排出データセットにおいて、DRCR推定量は最小二乗法(0.1516)および線形回帰(0.1692)よりも低い平均テスト$l_1$誤差(0.1294)を達成した。
- 実験結果は、DRCR定式化における勾配に基づく正則化が、手法のロバスト性と性能の中心的役割を果たしていることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。