Skip to main content
QUICK REVIEW

[論文レビュー] Ethical Adversaries: Towards Mitigating Unfairness with Adversarial Machine Learning

Pieter Delobelle, Paul Temple|Repository of the University of Namur|May 14, 2020
Ethics and Social Impacts of AI参考文献 41被引用数 10
ひとこと要約

本論文は、勾配反転と反復的回避攻撃を組み合わせることで、機械学習モデルにおける不平等を軽減する新しい敵対的フレームワークを提案する。保護された属性を推測することを防ぐようにモデルを訓練すると同時に、敵対的例を用いて公平性を向上させる手法により、COMPAS、German Credit、Adult データセットにおいて、最小限のユーティリティ損失で、デモグラフィックパリティおよび同等機会の分野で最先端の性能を達成した。

ABSTRACT

Machine learning is being integrated into a growing number of critical systems with far-reaching impacts on society. Unexpected behaviour and unfair decision processes are coming under increasing scrutiny due to this widespread use and its theoretical considerations. Individuals, as well as organisations, notice, test, and criticize unfair results to hold model designers and deployers accountable. We offer a framework that assists these groups in mitigating unfair representations stemming from the training datasets. Our framework relies on two inter-operating adversaries to improve fairness. First, a model is trained with the goal of preventing the guessing of protected attributes' values while limiting utility losses. This first step optimizes the model's parameters for fairness. Second, the framework leverages evasion attacks from adversarial machine learning to generate new examples that will be misclassified. These new examples are then used to retrain and improve the model in the first step. These two steps are iteratively applied until a significant improvement in fairness is obtained. We evaluated our framework on well-studied datasets in the fairness literature -- including COMPAS -- where it can surpass other approaches concerning demographic parity, equality of opportunity and also the model's utility. We also illustrate our findings on the subtle difficulties when mitigating unfairness and highlight how our framework can assist model designers.

研究の動機と目的

  • 機械学習モデルにおける割り当ての不公平性、特にハイステイクス意思決定システムにおける問題を解決すること。
  • モデルのユーティリティを著しく低下させることなく、公平性を向上させるフレームワークを開発すること。
  • 特に回避攻撃を含む敵対的機械学習技術を、公平性軽減に活用することの可能性を調査すること。
  • COMPAS、German Credit、Adult などの実世界の公平性ベンチマークデータセット上でフレームワークを評価すること。
  • 反復的敵対的例生成が、モデル表現に潜む隠れた不公平性を特定・是正できることを示すこと。

提案手法

  • フレームワークは、二つの相互作用する敵対的エージェントを採用する:勾配反転を用いて保護された属性の予測能力を最小化する敵対的リーダー。
  • 敵対的フィーダーは、モデルをだますために敵対的例を生成する回避攻撃を実行し、その例を再訓練用に使用する。
  • 敵対的訓練による公平性向上と、入力空間の未利用領域を探索するための回避攻撃生成を交互に繰り返すプロセス。
  • 回避攻撃で使用されるスラッグモデルは、勾配ベース最適化を活用して、敵対的摂動をターゲットモデルに伝達できるように訓練される。
  • 反復的にフレームワークを適用し、攻撃と再訓練の繰り返しによって、モデルの公平性と耐性を段階的に向上させる。
  • ユーティリティの評価には、バイナリ分類の正確性とマクロ平均F1スコアを、公平性の評価にはデモグラフィックパリティ(DP、DPR)と同等機会(EO)を用いる。

実験結果

リサーチクエスチョン

  • RQ1回避攻撃を、機械学習モデルの公平性向上に再利用することは効果的か?
  • RQ2勾配反転と反復的敵対的例生成を組み合わせることで、既存の手法よりも優れた公平性-ユーティリティのトレードオフが達成できるか?
  • RQ3COMPAS や German Credit のような、既知の公平性問題を有する実世界のデータセットにおいて、このフレームワークはどのように性能を発揮するか?
  • RQ4モデルのユーティリティを損なうことなく、割り当てによる害を検出・是正できるか?
  • RQ5移譲可能な敵対的例は、公平性軽減において入力空間のカバレッジをどの程度向上させるか?

主な発見

  • COMPAS データセットでは、最高のデモグラフィックパリティ(DP)を達成し、同等機会の差異(EO = 0.008)を顕著に低減し、ベースラインおよびGRLを上回った。
  • German Credit データセットでは、DPR = 0.926 という公平性指標を改善しながらも、高いユーティリティを維持し、正確性とF1スコアがベースラインを上回った。
  • Adult データセットでは、公平性制約付きモデルの中で最高のユーティリティを達成し、DPおよびEOの両方で顕著な公平性向上を示した。
  • フレームワークは、勾配反転だけでは公平性に不十分であることを示したが、敵対的例生成と組み合わせることで、本質的に公平性の高いモデルが得られることを明らかにした。
  • 反復的な回避攻撃の使用により、入力空間のこれまで未発見の領域が特定され、モデルの耐性と公平性が向上した。
  • オープンソース実装は https://github.com/iPieter/ethical-adversaries で、MITライセンスのもと公開されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。