Skip to main content
QUICK REVIEW

[論文レビュー] Intra-Processing Methods for Debiasing Neural Networks

Yash Savani, Colin White|arXiv (Cornell University)|Jun 15, 2020
Adversarial Robustness in Machine Learning被引用数 9
ひとこと要約

本稿は、適応段階でモデル重みを活用する、ファインチューニング済みニューラルネットワークのデバイアス化のための新パラダイム「イントラプロセッシング」を提案する。ランダムノイズ付与、レイヤーワイズ最適化、敵対的ファインチューニングの3つの新手法を提示し、特にResNetのような複雑なモデルをCelebAで使用した場合、ポストプロセッシングに比べて優れた公平性と精度のトレードオフを実現することを示した。

ABSTRACT

As deep learning models become tasked with more and more decisions that impact human lives, such as criminal recidivism, loan repayment, and face recognition for law enforcement, bias is becoming a growing concern. Debiasing algorithms are typically split into three paradigms: pre-processing, in-processing, and post-processing. However, in computer vision or natural language applications, it is common to start with a large generic model and then fine-tune to a specific use-case. Pre- or in-processing methods would require retraining the entire model from scratch, while post-processing methods only have black-box access to the model, so they do not leverage the weights of the trained model. Creating debiasing algorithms specifically for this fine-tuning use-case has largely been neglected. In this work, we initiate the study of a new paradigm in debiasing research, intra-processing, which sits between in-processing and post-processing methods. Intra-processing methods are designed specifically to debias large models which have been trained on a generic dataset and fine-tuned on a more specific task. We show how to repurpose existing in-processing methods for this use-case, and we also propose three baseline algorithms: random perturbation, layerwise optimization, and adversarial fine-tuning. All of our techniques can be used for all popular group fairness measures such as equalized odds or statistical parity difference. We evaluate these methods across three popular datasets from the AIF360 toolkit, as well as on the CelebA faces dataset. Our code is available at https://github.com/abacusai/intraprocessing_debiasing.

研究の動機と目的

  • 大規模な事前学習モデルのファインチューニングに特化したデバイアス化手法の欠如に対処し、事前およびポストプロセッシングが不適切である状況を補う。
  • 既に訓練済みのモデルにアクセス可能な重みを用いて動作する、「イントラプロセッシング」と呼ばれる新しいデバイアス化アルゴリズムのクラスを構築する。
  • 通常ファインチューニングされるため、実世界の応用分野(顔認識やローン予測など)における公平性の向上を可能にする。
  • AIF360やCelebAを含む複数の公平性定義およびデータセットを用いてイントラプロセッシング手法を評価し、その頑健性と優位性を確立する。
  • モデルの複雑さが増すと、イントラプロセッシングがポストプロセッシングを上回る公平性-精度のトレードオフを示すことを実証する。

提案手法

  • 公平性のための敵対的訓練(adversarial training)という既存のインプロセッシング手法を、バイアス検出のためのコーチネットワークをモデル重み上で学習させることで、イントラプロセッシングフレームワークに再利用する。
  • ネットワーク重みに逐次乗法的ノイズを適用し、公平性-精度の目的関数を最大化するノイズを選択する、ランダムノイズ付与法を提案する。
  • 勾配ブースティング回帰木(GBRT)を用いて個々のレイヤーをファインチューニングし、公平性を向上させるレイヤーワイズ最適化を導入する。
  • 重みに基づくバイアスプロキシとして微分可能で、モデル重み内のバイアスを直接測定可能なコーチネットワークを設計し、勾配ベース最適化を可能にする。
  • すべてのイントラプロセッシング手法に共通して使用する、精度と公平性のトレードオフを定式化した目的関数(例:ε=0.05の式1)を定式化する。
  • すべての手法を、ImageNetで事前学習済みのモデル(例:CelebAでの『若者』または『笑顔』の分類など)の下流タスクに適応させる。

実験結果

リサーチクエスチョン

  • RQ1イントラプロセッシング手法は、再訓練を伴わず、ファインチューニング済みニューラルネットワークのバイアスを効果的に低減できるか?
  • RQ2多様なデータセットにおいて、イントラプロセッシングとポストプロセッシングの公平性-精度のトレードオフを比較した場合、性能はどの程度か?
  • RQ3初期のランダム重み初期化が、ファインチューニング済みモデルのバイアスに顕著に影響を与えるか? また、これはデバイアス化の有効性にどのように影響するか?
  • RQ4異なるイントラプロセッシング手法(ランダムノイズ付与、レイヤーワイズ最適化、敵対的ファインチューニング)は、モデルおよびデータセットの複雑さにどのようにスケーリングするか?
  • RQ5イントラプロセッシング手法は、公平性と精度の両方を同時に向上させることで、ポストプロセッシングをパレート支配できるか?

主な発見

  • イントラプロセッシング手法は、ポストプロセッシング手法(例:等しいオッズのポストプロセッシング)に比べ、公平性指標で顕著に優れている。
  • CelebAデータセットとResNet18を用いた場合、敵対的ファインチューニングはバランス精度0.914(シード1)を達成し、デフォルトモデル(0.819)およびポストプロセッシング手法を上回った。
  • 異なるランダムシード間でのバイアスの分散は、精度の分散よりも顕著に高かったため、初期モデル重みが公平性の結果に強く影響することが示された。
  • 複雑なモデルおよびデータセット(例:CelebAにおけるResNet)では、敵対的ファインチューニングが、ランダムノイズ付与やレイヤーワイズ最適化といった単純な手法を常に上回った。
  • イントラプロセッシング手法は、バイアススコアを低く抑えつつ、精度を維持または向上させ、複数の設定でポストプロセッシングをパレート支配した。
  • 正則化により、特にデータセットサイズが限られた場合に、テストセット全体でのバイアススコアの安定性が向上し、デバイアス化性能の一貫性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。