Skip to main content
QUICK REVIEW

[論文レビュー] Is Importance Weighting Incompatible with Interpolating Classifiers?

Ke Alexander Wang, Niladri S. Chatterji|arXiv (Cornell University)|Dec 24, 2021
Neural Networks and Applications被引用数 4
ひとこと要約

この論文は、交差エントロピーのような指数的尾部損失が重要度重みの影響を抑えることにより、過パrameter化モデルにおける重要度重みの無効性というパラドックスを解明する。著者らは、重要度重みの補正力を回復させる多項式的尾部損失を提案し、理論的および実験的に、このような損失関数と指数的に重みを上げた重要度重みが、ラベルシフトおよびサブポピュレーションシフト下での一般化性能を向上させることを示しており、再重み付けされた交差エントロピーと比較して最高で9%高いテスト精度を達成している。

ABSTRACT

Importance weighting is a classic technique to handle distribution shifts. However, prior work has presented strong empirical and theoretical evidence demonstrating that importance weights can have little to no effect on overparameterized neural networks. Is importance weighting truly incompatible with the training of overparameterized neural networks? Our paper answers this in the negative. We show that importance weighting fails not because of the overparameterization, but instead, as a result of using exponentially-tailed losses like the logistic or cross-entropy loss. As a remedy, we show that polynomially-tailed losses restore the effects of importance reweighting in correcting distribution shift in overparameterized models. We characterize the behavior of gradient descent on importance weighted polynomially-tailed losses with overparameterized linear models, and theoretically demonstrate the advantage of using polynomially-tailed losses in a label shift setting. Surprisingly, our theory shows that using weights that are obtained by exponentiating the classical unbiased importance weights can improve performance. Finally, we demonstrate the practical value of our analysis with neural network experiments on a subpopulation shift and a label shift dataset. When reweighted, our loss function can outperform reweighted cross-entropy by as much as 9% in test accuracy. Our loss function also gives test accuracies comparable to, or even exceeding, well-tuned state-of-the-art methods for correcting distribution shifts.

研究の動機と目的

  • 過パrameter化された補間分類器において理論的に妥当であるにもかかわらず、なぜ重要度重みが失敗するのかというパラドックスを解消すること。
  • その失敗の根本的要因を同定することであり、著者らが示すところでは、過パrameter化そのものではなく、交差エントロピーのような指数的尾部損失の使用が原因である。
  • 勾配降下法下でも重要度重みの影響を保持する多項式的尾部損失を用いた新たな学習目的関数を提案すること。
  • 指数的に重みを上げた重要度重みと多項式的尾部損失を組み合わせた場合、ラベルシフトおよびサブポピュレーションシフト設定下で一般化性能が向上することを理論的および実験的に検証すること。
  • ニューラルネットワークにおける分布シフトの是正において、再重み付けされた交差エントロピーおよび最先端手法を上回る実用的優位性を示すこと。

提案手法

  • ロジスティック関数や交差エントロピー損失のような指数的尾部を持つものとは対照的に、多項式的減衰尾部を持つ新たな損失関数を提案する。
  • 重みを $ c $ 乗($ c > 1 $)することで、まれだが重要なサンプルの影響を強化する指数的重みを用いる。
  • 理論的分析により、多項式的尾部損失の勾配降下法は、最大マージン分類器とは異なり、データと重要度重みの両方に依存する方向に収束することを示している。
  • ミニバッチレベルでの正規化ではなく、全訓練セット全体にわたる重要度重みの正規化により、学習の安定性を高める。
  • 過学習を防ぐために、重要度重み付きのバリデーション精度に基づく早期停止をニューラルネットワークに適用する。
  • 訓練集合とテスト集合のグループ頻度から計算される不偏な重要度重みを用い、指数化および正規化することで最適化の安定性を確保する。

実験結果

リサーチクエスチョン

  • RQ1交差エントロピーのような指数的尾部損失を用いて学習される過パrameter化モデルにおいて、なぜ重要度重みが失敗するのか?
  • RQ2損失関数の構造を変更することで、補間モデルにおける重要度重みの有効性を回復させることは可能か?
  • RQ3多項式的尾部損失と指数的に重みを上げた重要度重みを用いることで、ラベルシフト下での一般化性能が向上するか?
  • RQ4線形モデルにおいて、再重み付けされた多項式的尾部損失を最小化する勾配降下法の暗黙のバイアスは何か?
  • RQ5このアプローチは、ニューラルネットワークにおける分布シフト是正において、再重み付けされた交差エントロピーおよび最先端手法を上回る性能を示せるか?

主な発見

  • 過パrameter化モデルにおける重要度重みの失敗は、過パrameter化そのものではなく、指数的尾部損失の使用に起因する。
  • 多項式的尾部損失は重要度重みの影響を回復させ、勾配降下法がデータと重みの両方に依存する方向に収束することを可能にする。
  • 指数的に重みを上げた重要度重みを用いることで、ラベルシフト下では大標本極限において分類器のテスト誤差がゼロに収束するが、最大マージン分類器は1/8の下限を持つ。
  • 不均衡なバイナリCIFAR10データセットでは、提案手法が平均67.3%のテスト精度を達成し、再重み付けされた交差エントロピー(57.8%)を上回り、最先端手法と同等またはそれを上回る。
  • スプライスな相関関係を有するサブサンプルされたCelebAデータセットでは、平均82.4%のテスト精度と53.3%の最悪グループ精度を達成し、再重み付けされた交差エントロピー(79.3%および43.1%)を上回り、DROベースの手法と同等またはそれを上回る。
  • 一部の設定では、再重み付けされた交差エントロピーと比較して、テスト精度が最大で9%向上し、顕著な実用的利点を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。