Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Sampling for Minimax Fair Classification

Shubhanshu Shekhar, Fields, Greg|arXiv (Cornell University)|Mar 1, 2021
Imbalanced Data Classification Techniques参考文献 27被引用数 5
ひとこと要約

本稿では、不確実性への楽観的アプローチを用いて、代表が不十分なグループからのトレーニングデータを戦略的に選択することで、機械学習におけるミニマックス公平性を向上させる適応的サンプリングアルゴリズム $τ_{\texttt{opt}}$ を提案する。この手法は、合成および実世界のタスクにおいて、ユニフォームサンプリングやグリーディサンプリングを上回り、Cifar10、UTKFace、およびテーブルデータにおけるCNNを含む、最小グループの正答率が最大でユニフォームサンプリングと比較して4.5%向上する近ミニマックス最適性能を達成する。

ABSTRACT

Machine learning models trained on uncurated datasets can often end up adversely affecting inputs belonging to underrepresented groups. To address this issue, we consider the problem of adaptively constructing training sets which allow us to learn classifiers that are fair in a minimax sense. We first propose an adaptive sampling algorithm based on the principle of optimism, and derive theoretical bounds on its performance. We also propose heuristic extensions of this algorithm suitable for application to large scale, practical problems. Next, by deriving algorithm independent lower-bounds for a specific class of problems, we show that the performance achieved by our adaptive scheme cannot be improved in general. We then validate the benefits of adaptively constructing training sets via experiments on synthetic tasks with logistic regression classifiers, as well as on several real-world tasks using convolutional neural networks (CNNs).

研究の動機と目的

  • ミニマックス公平性基準下で、最も成績が悪いグループの予測精度を向上させることにより、機械学習における公平性を改善すること。
  • グループの難易度に関する事前知識がなくとも、学習が難しいグループにトレーニング予算を動的に割り当てる適応的サンプリング戦略を開発すること。
  • ミニマックス公平性の下で、提案されたサンプリング方式の収束性と最適性を理論的に分析すること。
  • ロジスティック回帰およびディープラーニングモデルを用いて、画像およびテーブルデータを含む多様なデータセット上で、この手法の実証的妥当性を検証すること。
  • 推論時にグループアイデンティティに依存せずに、適応的サンプリングが優れた公平性を達成できることを示すこと。

提案手法

  • コアとなる手法 $\mathcal{A}_{\texttt{opt}}$ は、バンディット文献における楽観的原理を用い、グループ固有の予測リスクの不確実性を推定し、不確実性が大きいグループからのサンプリングを優先する。
  • アルゴリズムはリスク推定値の信頼区間を維持し、上側信頼区間が最大のグループからサンプルを選択することで、探索と活用のバランスを取る。
  • 理論的分析により、収束速度の上界が確立され、問題クラスに対する一致する下界を導出することで、近ミニマックス最適性が証明される。
  • 大規模応用、特にディープニューラルネットワーク向けに、$\mathcal{A}_{\texttt{opt}}$ のヒューリスティックな変種が導入され、計算効率が向上する。
  • アクティブラーニングの文脈で、推定されたリスク格差に基づき、異なる保護対象グループから逐次的にサンプルが抽出される。
  • 実験では、CNNおよびロジスティック回帰を含む複数のデータセットとモデルで、$\mathcal{A}_{\texttt{opt}}$ がユニフォームおよびグリーディサンプリング戦略と比較される。

実験結果

リサーチクエスチョン

  • RQ1適応的サンプリング戦略は、代表が不十分なグループにトレーニングデータを動的に割り当てることで、ミニマックス公平性を向上させることができるか?
  • RQ2提案された楽観的サンプリングアルゴリズムは、ミニマックス公平分類において理論的に近ミニマックス最適であるか?
  • RQ3実世界および合成データセットにおいて、適応的サンプリングの性能はユニフォームおよびグリーディサンプリングと比較してどのように異なるか?
  • RQ4適応的サンプリング手法は、画像およびテーブル分類タスクにおける最小グループの正答率をどの程度向上させるか?
  • RQ5このアルゴリズムは、多様なデータ分布およびモデルアーキテクチャにおいて、公平性の向上を維持するか?

主な発見

  • Cifar10では、$\mathcal{A}_{\texttt{opt}}$ が属性ごとの最小テスト正答率0.743 ± 0.004を達成し、ユニフォームサンプリング(0.726 ± 0.010)を1.7ポイント上回った。
  • UTKFaceでは、$\mathcal{A}_{\texttt{opt}}$ が最小正答率0.946 ± 0.003を達成し、ユニフォームサンプリング(0.919 ± 0.008)を顕著に上回った。
  • FashionMNISTでは、$\mathcal{A}_{\texttt{opt}}$ が0.936 ± 0.004を達成し、ユニフォームサンプリング(0.893 ± 0.002)を4.3ポイント上回った。
  • ドイツのデータセットでは、$\mathcal{A}_{\texttt{opt}}$ が最小正答率0.721 ± 0.035を達成し、小さなデータセットサイズによる高い分散にもかかわらず、ユニフォーム(0.716 ± 0.032)を一貫して上回った。
  • すべてのデータセットにおいて、適応的スキームは最小グループの正答率を一貫して向上させ、特にCifar10やUTKFaceのような不均衡または複雑なデータセットで相対的な利得が最大となった。
  • 理論的分析により、$\mathcal{A}_{\texttt{opt}}$ の性能が近ミニマックス最適であることが確認された。これは、問題クラスに対する超過リスクの導出下限と一致するためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。