Skip to main content
QUICK REVIEW

[論文レビュー] Fairness-aware Adversarial Perturbation Towards Bias Mitigation for Deployed Deep Models

Zhibo Wang, Xiaowei Dong|arXiv (Cornell University)|Mar 3, 2022
Ethics and Social Impacts of AI被引用数 4
ひとこと要約

この論文では、モデルのアーキテクチャやパラメータを変更せずに、展開済みのディープラーニングモデルにおけるバイアスを軽減するための新規手法 Fairness-aware Adversarial Perturbation (FAAP) を提案する。FAAP は、保護属性(例:性別、民族)がモデルの潜在空間で区別できなくなるように入力データを摂動する敵対的ジェネレータを用いる。これにより、不平等な予測が低減される。本手法は、最小限の精度低下で、商用 API において、デモグラフィックパリティ差を最大 66.1% 減少させ、等しい機会差を 61.9% 改善した。

ABSTRACT

Prioritizing fairness is of central importance in artificial intelligence (AI) systems, especially for those societal applications, e.g., hiring systems should recommend applicants equally from different demographic groups, and risk assessment systems must eliminate racism in criminal justice. Existing efforts towards the ethical development of AI systems have leveraged data science to mitigate biases in the training set or introduced fairness principles into the training process. For a deployed AI system, however, it may not allow for retraining or tuning in practice. By contrast, we propose a more flexible approach, i.e., fairness-aware adversarial perturbation (FAAP), which learns to perturb input data to blind deployed models on fairness-related features, e.g., gender and ethnicity. The key advantage is that FAAP does not modify deployed models in terms of parameters and structures. To achieve this, we design a discriminator to distinguish fairness-related attributes based on latent representations from deployed models. Meanwhile, a perturbation generator is trained against the discriminator, such that no fairness-related features could be extracted from perturbed inputs. Exhaustive experimental evaluation demonstrates the effectiveness and superior performance of the proposed FAAP. In addition, FAAP is validated on real-world commercial deployments (inaccessible to model parameters), which shows the transferability of FAAP, foreseeing the potential of black-box adaptation.

研究の動機と目的

  • 再トレーニングや構造的変更が不可能な展開済みのディープラーニングモデルにおける公平性の問題に対処すること。
  • モデルのパラメータやアーキテクチャにアクセスできない状況でも、推論時に公平性を向上させる手法を開発すること。
  • 入力の摂動によって保護属性をモデルの表現から隠すことで、ブラックボックスでの公平性軽減を可能にすること。
  • モデルの精度や一般化性能を保持したまま、強力な公平性の向上を達成すること。

提案手法

  • 保護属性(例:性別)が入力データの潜在空間で見えにくくなるように、敵対的摂動を生成するジェネレータネットワークを訓練する。
  • 展開済みモデルの潜在表現から、保護属性(例:性別)を分類するためのディスクリミネータを訓練する。
  • ジェネレータとディスクリミネータを敵対的に訓練し、ジェネレータがディスクリミネータに保護属性を検出させないようにする。
  • 展開済みモデルの潜在空間表現を活用して摂動生成をガイドすることで、公平性関連の特徴を効果的に隠す。
  • ターゲットモデルがブラックボックスの場合、ジェネレータの訓練にスレーブモデル(例:通常または公平に訓練されたモデル)を用いて、転送性を実現する。
  • 合成データおよび実世界の商用 API に対して、デモグラフィックパリティ(DP)や等しい機会差(DEO)といった公平性指標を用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1パラメータやアーキテクチャを変更せずに、敵対的摂動を用いて展開済みのディープラーニングモデルにおける公平性バイアスを軽減できるか?
  • RQ2提案手法は、実世界のブラックボックスモデルにおいて、デモグラフィックパリティ差と等しい機会差をどれほど効果的に低減できるか?
  • RQ3スレーブモデルで訓練された摂動は、アクセス不可能な商用 API にどれほど転送可能か?
  • RQ4大幅な公平性向上を達成する一方で、モデルの精度を保持できるか?
  • RQ5摂動は、潜在空間において保護属性と予測との相関を効果的に解消できるか?

主な発見

  • FAAP は、通常訓練されたモデルにおいて、デモグラフィックパリティ(DP)を平均で 27.5% 向上させ、等しい機会差(DEO)を 66.1% 減少させ、精度低下はたった 1.5% にとどまった。
  • アリババの商用 API において、DEO を 0.0952 から 0.0368 に低下させ、DP を 0.1768 から 0.1475 に改善し、精度低下は 0.26% にとどまった。
  • バイドウの商用 API において、DP は 41.1% 向上し、DEO は 64.8% 減少させ、精度低下は 2.89% だった。
  • T-SNE 視覚化により、FAAP の摂動が、異なる保護属性(例:男性/女性)の表現を潜在空間で混合させ、分離性を低下させていることが確認された。
  • 本手法は実世界のブラックボックス API に対しても強力な転送性を示し、生産環境への実用的導入の可能性を示した。
  • 一貫した公平性の向上が複数のデータセットとモデルで確認されたことから、本手法は保護属性と予測との相関を効果的に解消しながら、モデルの有用性を維持していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。