Skip to main content
QUICK REVIEW

[論文レビュー] Fairness Through Robustness: Investigating Robustness Disparity in Deep Learning

Vedant Nanda, Samuel Dooley|arXiv (Cornell University)|Jun 17, 2020
Adversarial Robustness in Machine Learning参考文献 61被引用数 16
ひとこと要約

この論文は、特定のサブグループ(例:人種や性別)が意思決定境界に近いため、敵対的摂動に対してより脆弱であるという、深層ニューラルネットワークにおけるレジリエンスバイアス—つまり、不公平な振るまいの一種—を導入する。著者らは、敵対的攻撃とランダムスムージングを用いてこのバイアスを測定する手法を提案し、CIFAR-10、CIFAR-100、Adience、UTKFaceの最先端モデルにおいて、特定のサブグループが顕著に脆弱であるという実証的証拠を示している。

ABSTRACT

Deep neural networks (DNNs) are increasingly used in real-world applications (e.g. facial recognition). This has resulted in concerns about the fairness of decisions made by these models. Various notions and measures of fairness have been proposed to ensure that a decision-making system does not disproportionately harm (or benefit) particular subgroups of the population. In this paper, we argue that traditional notions of fairness that are only based on models' outputs are not sufficient when the model is vulnerable to adversarial attacks. We argue that in some cases, it may be easier for an attacker to target a particular subgroup, resulting in a form of extit{robustness bias}. We show that measuring robustness bias is a challenging task for DNNs and propose two methods to measure this form of bias. We then conduct an empirical study on state-of-the-art neural networks on commonly used real-world datasets such as CIFAR-10, CIFAR-100, Adience, and UTKFace and show that in almost all cases there are subgroups (in some cases based on sensitive attributes like race, gender, etc) which are less robust and are thus at a disadvantage. We argue that this kind of bias arises due to both the data distribution and the highly complex nature of the learned decision boundary in the case of DNNs, thus making mitigation of such biases a non-trivial task. Our results show that robustness bias is an important criterion to consider while auditing real-world systems that rely on DNNs for decision making. Code to reproduce all our results can be found here: \url{https://github.com/nvedant07/Fairness-Through-Robustness}

研究の動機と目的

  • 深層学習における新たな不公平の形態—意思決定境界への近接性により特定のサブグループが敵対的摂動に対してより脆弱であるという、レジリエンスバイアスを特定および定義すること。
  • 深層ニューラルネットワークの非凸的かつ複雑な意思決定境界のため、レジリエンスバイアスを測定することが困難であるという課題に対処すること。
  • CIFAR-10、CIFAR-100、Adience、UTKFaceといった実世界のデータセットに学習させた最先端モデルにおいて、レジリエンスバイアスが実際に存在するかどうかを実証的に調査すること。
  • 正則化技術がレジリエンスバイアスを軽減できるかどうかを評価することと、その軽減が社会的・倫理的文脈の中で文脈的に捉えられるべきであることを強調すること。
  • 特に高リスクの実世界の展開において、出力の公平性だけでなく、耐性の公平性についてもDNNを監査すべきであるという主張を展開すること。

提案手法

  • 異なる人種や性別などのサブグループ間で、データポイントの意思決定境界からの平均距離に差が生じることを、レジリエンスバイアスとして定義する。
  • 敵対的攻撃(例:PGD や AutoAttack)を用いて、予測を変更するために必要な最小摂動を推定し、意思決定境界からの距離の代理指標とする。
  • ランダムスムージングを適用して、摂動を加えた入力の予測を平均化することで、個々のデータポイントの耐性推定値を向上させ、信頼性を高める。
  • サブグループとデータセット全体の残りの部分との間で、耐性距離が閾値τを超える正しく分類されたポイントの割合の差の絶対値として、測定可能なレジリエンスバイアススコアを定式化する。
  • マイノリティグループとマジョリティグループ間の耐性の差をペナルティとする正則化訓練目的関数を提案し、モデル学習段階でレジリエンスバイアスを最小化することを目的とする。
  • 正則化手法を複数のモデルとデータセットに実装・評価し、レジリエンスバイアスの低減効果を検証する。

実験結果

リサーチクエスチョン

  • RQ1顔貌や性別といった感受性の高い属性によって定義されるサブグループは、最先端の深層ニューラルネットワークにおいて、敵対的摂動に対して顕著に異なる耐性を示すか?
  • RQ2敵対的攻撃とランダムスムージングを用いることで、複雑なDNNにおけるデータポイントの意思決定境界からの距離を信頼性高く推定できるか?
  • RQ3レジリエンスバイアスはデータ分布やモデルアーキテクチャとどのように相関し、学習プロセスはその出現にどのような役割を果たすか?
  • RQ4標準的な正則化技術は、レジリエンスバイアスを効果的に低減できるか?そのアプローチの限界は何か?
  • RQ5出力ベースの公平性指標を超えて、レジリエンスバイアスは公平性監査の意味のある測定基準となり得るか?

主な発見

  • CIFAR-10、CIFAR-100、Adience、UTKFaceにおけるほぼすべての評価済み最先端モデルに、特定のサブグループが意思決定境界に近いというレジリエンスバイアスが存在する。
  • UTKFaceおよびAdienceデータセットにおける人種や性別に基づくサブグループは、顕著に低い耐性を示しており、他のサブグループと比較して最大20%も敵対的攻撃に対して脆弱である。
  • 敵対的攻撃とランダムスムージングの併用により、極めて非凸的な深層ニューラルネットワークでさえも、耐性距離の信頼性ある推定が可能である。
  • レジリエンスバイアススコアに基づく正則化は、サブグループ間の耐性格差を低減させ、モデル学習の修正によってバイアスの軽減が可能であることを示している。
  • レジリエンスバイアスは単にデータのアンバランスに起因するのではなく、データ分布とDNNが学習する複雑で非線形な意思決定境界との相互作用に起因する。
  • 本研究では、モデルが予測精度において公平であっても、依然として顕著な耐性格差を示すことが判明しており、耐性を公平性基準として考慮すべきであることが強調されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。