[論文レビュー] Fair Infinitesimal Jackknife: Mitigating the Influence of Biased Training Data Points Without Refitting
本稿では、Fair Infinitesimal Jackknife (Fair-IJ) を提案する。これは、再訓練を必要とせず、モデルの再適合が困難な大規模な事前学習モデルにおいても、グループの不平等度を測る指標に顕著に影響を与える訓練データポイントを同定し、近似的に除去することで、公平性を向上させる後処理手法である。この手法は、Hessian の逆行列を直接計算せずに安定的かつ効率的な影響推定を実現する IHVP-WoodFisher 法を用いる。予測精度を維持したまま、デモグラフィックパリティと同等の機会の不平等度の指標を顕著に低減する。
In consequential decision-making applications, mitigating unwanted biases in machine learning models that yield systematic disadvantage to members of groups delineated by sensitive attributes such as race and gender is one key intervention to strive for equity. Focusing on demographic parity and equality of opportunity, in this paper we propose an algorithm that improves the fairness of a pre-trained classifier by simply dropping carefully selected training data points. We select instances based on their influence on the fairness metric of interest, computed using an infinitesimal jackknife-based approach. The dropping of training points is done in principle, but in practice does not require the model to be refit. Crucially, we find that such an intervention does not substantially reduce the predictive performance of the model but drastically improves the fairness metric. Through careful experiments, we evaluate the effectiveness of the proposed approach on diverse tasks and find that it consistently improves upon existing alternatives.
研究の動機と目的
- 再訓練がコスト的・モデルサイズ的要因により困難な状況下でも、再訓練を伴わずに高配分の機械学習意思決定における公平性を改善すること。
- テスト時における予測の変更ではなく、影響力の大きい訓練インスタンスを標的とすることでバイアスを緩和する後処理手法の開発。
- BERT などの大規模モデルにおいて、完全なファインチューニングを伴わずに、効率的な影響推定を用いて公平性を向上させること。
- 予測性能を高水準に維持しつつ、デモグラフィックパリティや同等の機会の不平等度といったグループの不公平度指標を顕著に低減すること。
提案手法
- 各訓練インスタンスがデモグラフィックパリティや同等の機会の不平等度といった公平性指標に与える影響を、影響関数を用いて推定する。
- 各訓練点が関心のある公平性指標に与える影響を推定するために、無限小ジャッキーク法の近似を採用する。
- Hessian の逆行列計算を回避するため、安定的かつ効率的な逆Hessian-ベクトル積を計算するための新規な IHVP-WoodFisher 法を開発する。
- 影響力が強く、不公平に寄与する訓練インスタンスを同定し、その影響を近似的に除去することで、グループ公平性への影響を低減する。
- モデルの訓練後処理として適用可能であり、再訓練を必要としないため、BERT などの大規模モデルにも容易に適用可能である。
- プロンプトチューニングを介して、最適化対象となるトークンが少数であるような、NLP などの複雑なモダリティにも適応可能である。
実験結果
リサーチクエスチョン
- RQ1再訓練を伴わず、影響力の大きい訓練データポイントを効果的に除去することで、事前学習モデルの公平性を向上させることは可能か?
- RQ2大規模モデルにおいて、訓練インスタンスの公平性指標への影響を、効率的かつ安定的に推定することは可能か?
- RQ3影響力の強いバイアスを有するデータポイントを除去することで、従来の後処理手法と比較して、公平性と精度のトレードオフを改善できるか?
- RQ4プロンプトチューニングのようなパラメータ効率の良いチューニング手法を用いても、大規模な事前学習言語モデルにこの手法を効果的に適用できるか?
主な発見
- Adult データセットでは、Fair-IJ の適用によりデモグラフィックパリティが 0.18 から 0.01 に低下したが、精度の著しい低下は認められなかった。
- Coverage データセットでは、Fair-IJ の適用後、デモグラフィックパリティが 0.22 から 0.01 に改善された。
- ムスリムを感受性属性とする CivilComments データセットでは、BERT TT=4 の場合、デモグラフィックパリティがベースラインの 0.268 から 0.042 に低下し、BERT TT=10 の場合、0.254 から 0.089 に低下した。
- Fair-IJ は、すべてのテストされた BERT バリエーションにおいて、ERM やギャップ正則化を上回る公平性の向上を達成したが、バランス精度は維持または向上させた。
- わずか数個の学習可能トークンを有するプロンプトチューニングされた BERT モデルに対しても、Fair-IJ は顕著な公平性の向上を達成した。
- IHVP-WoodFisher 近似は安定的かつ効率的であり、制限的な曲率仮定を課さずに、大規模モデルにおけるスケーラブルな影響推定を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。