[論文レビュー] Selective Classification Can Magnify Disparities Across Groups
この論文は、不確実性がある場合に予測を控える選択的分類(selective classification)が、誤り相関が存在する場合、人種的・文化的背景ごとの精度格差を悪化させる可能性があることを示している。著者らは、選択的分類がすでに成績が低いグループの性能をさらに悪化させる傾向があることを示し、この問題を緩和するための分布的に頑健なモデルの訓練を提案している。
Selective classification, in which models can abstain on uncertain predictions, is a natural approach to improving accuracy in settings where errors are costly but abstentions are manageable. In this paper, we find that while selective classification can improve average accuracies, it can simultaneously magnify existing accuracy disparities between various groups within a population, especially in the presence of spurious correlations. We observe this behavior consistently across five vision and NLP datasets. Surprisingly, increasing abstentions can even decrease accuracies on some groups. To better understand this phenomenon, we study the margin distribution, which captures the model's confidences over all predictions. For symmetric margin distributions, we prove that whether selective classification monotonically improves or worsens accuracy is fully determined by the accuracy at full coverage (i.e., without any abstentions) and whether the distribution satisfies a property we call left-log-concavity. Our analysis also shows that selective classification tends to magnify full-coverage accuracy disparities. Motivated by our analysis, we train distributionally-robust models that achieve similar full-coverage accuracies across groups and show that selective classification uniformly improves each group on these models. Altogether, our results suggest that selective classification should be used with care and underscore the importance of training models to perform equally well across groups at full coverage.
研究の動機と目的
- 選択的分類が平均精度を向上させる一方で、人種的・文化的背景ごとの精度格差を悪化させるかどうかを調査すること。
- モデルの信頼度スコアのマージン分布を用いて、こうした格差の根本的原因を分析すること。
- 選択的分類が特定のグループに対して一貫して精度を向上または低下させる条件を同定すること。
- 分布的に頑健な最適化(DRO)を用いた緩和戦略を提案し、グループ間で均等な完全カバレッジ精度を達成すること。
- 完全カバレッジでの格差を是正することで、選択的分類がグループレベルの格差を拡大するのを防げることを実証すること。
提案手法
- マージン分布を、正しく予測されたおよび誤った予測におけるモデルの信頼度スコアの分布として定義する。
- 選択的分類がグループの精度を向上または悪化させるかどうかを特徴付けるために、左対数凹性(left-log-concavity)の概念を導入する。
- 対称的なマージン分布に対しては、選択的分類における精度向上の単調性が、完全カバレッジ精度と左対数凹性によって完全に決定されることを証明する。
- ガウス混合マージン分布を用いたシミュレーションにより、グループに依存しないベースラインと比較して性能を評価する。
- 完全カバレッジにおける最悪グループ精度を最適化する分布的に頑健なモデル(DRO)を訓練し、その後選択的分類を適用する。
- 5つのビジョンおよびNLPデータセットにおいて、標準モデルとDROモデルの両方で選択的分類の性能を比較する。
実験結果
リサーチクエスチョン
- RQ1選択的分類はすべてのグループの精度を一様に向上させるのか、それとも成績が低いグループの性能を悪化させる可能性があるのか?
- RQ2特定のグループに対して、選択的分類が一貫して精度を向上または低下させる条件は何か?
- RQ3マージン分布の形状、特に左対数凹性が、選択的分類がグループ精度に与える影響にどのように寄与するか?
- RQ4グループ間で完全カバレッジ精度を同等にすることにより、選択的分類が引き起こす格差を緩和できるのか?
- RQ5選択的分類は、事前に存在するグループ間の精度格差をどの程度拡大させるのか?
主な発見
- 完全カバレッジ精度が低いグループでは、すくなくとも棄却率を高めても、精度が悪化する可能性がある。
- CheXpertデータセットの変種では、誤った相関(例:胸腔チューブ)を学習したモデルは、胸膜効果があるが補助装置がない患者に対して失敗する—臨床的に重要な事例である。
- マージン分布が左対数凹性である場合、選択的分類は一貫して精度を向上させるが、そうでない場合は悪化させる可能性がある。
- 対称的なマージン分布に対しては、精度向上の単調性が完全カバレッジ精度と左対数凹性によって完全に決定される。
- 選択的分類は、完全カバレッジ時点で既に存在する精度格差を拡大する傾向がある。
- 分布的に頑健な最適化(DRO)を用いて、グループ間の完全カバレッジ精度を均等化させることで、選択的分類がすべてのグループの精度を一様に向上させ、格差拡大を排除できる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。