[論文レビュー] Are Two Heads the Same as One? Identifying Disparate Treatment in Fair Neural Networks
本稿は、公平性正則化および事前処理を施したニューラルネットワークが、保護対象属性(例:人種、性別)を暗黙的に学習しており、これは米国法上、差別的取り扱いに該当することを示している。本稿では、保護対象属性を明示的に予測する二重ヘッドネットワークを提案し、ヘッドの統合によってデモグラフィックパラティーションを正確に制御可能にし、既存の公平性手法が差別的取り扱いの観点からこのアプローチと法的に同等であることを示している。
We show that deep networks trained to satisfy demographic parity often do so through a form of race or gender awareness, and that the more we force a network to be fair, the more accurately we can recover race or gender from the internal state of the network. Based on this observation, we investigate an alternative fairness approach: we add a second classification head to the network to explicitly predict the protected attribute (such as race or gender) alongside the original task. After training the two-headed network, we enforce demographic parity by merging the two heads, creating a network with the same architecture as the original network. We establish a close relationship between existing approaches and our approach by showing (1) that the decisions of a fair classifier are well-approximated by our approach, and (2) that an unfair and optimally accurate classifier can be recovered from a fair classifier and our second head predicting the protected attribute. We use our explicit formulation to argue that the existing fairness approaches, just as ours, demonstrate disparate treatment and that they are likely to be unlawful in a wide range of scenarios under US law.
研究の動機と目的
- 公平性正則化および事前処理を施したニューラルネットワークが、人種や性別などの保護対象属性を暗黙的に学習するかどうかを調査すること。
- このような暗黙的学習が、特にタイトルVIIに規定される米国反差別法の下で差別的取り扱いに該当するかどうかを評価すること。
- 保護対象属性を明示的に予測する二重ヘッドニューラルネットワークアーキテクチャを提案し、デモグラフィックパラティーションを制御可能にすること。
- 既存の公平性手法が、差別的取り扱いという観点から、提案された明示的アプローチと数学的・法的に同等であることを示すこと。
- 推定された保護対象属性に基づいて、公平なモデルによって系統的に不利を被る個人を特定し、隠れたバイアスを明らかにすること。
提案手法
- 主なタスクに加えて、保護対象属性(例:性別、人種)を明示的に予測する第二の分類ヘッドを備えた深層ニューラルネットワークを訓練する。
- 訓練後、二つのヘッドを統合して、デモグラフィックパラティーションに公平な分類器を構築し、保護対象属性ヘッドを効果的に削除しながらも公平性を維持する。
- 第二のヘッドの予測を用いて、公平性正則化または事前処理を施したモデルが生成した意思決定を再構築する。
- 公平モデルの予測と第二のヘッドからの保護対象属性予測を組み合わせることで、制約なし(不公平な)分類器を回復する。
- t-SNE可視化を用いて、公平性制約あり・なしのモデルの内部表現を分析し、保護グループごとの分離度が向上することを示す。
- 個人の推定された保護対象属性を変更した場合に予測が変化する割合を測定することで、差別的取り扱いの程度を定量化する。
実験結果
リサーチクエスチョン
- RQ1公平性正則化および事前処理を施したニューラルネットワークは、人種や性別などの保護対象属性を暗黙的に学習するか?
- RQ2デモグラフィックパラティーションの強化が進むにつれて、内部表現からの保護対象属性の予測可能性がどの程度上昇するか?
- RQ3保護対象属性を明示的に予測する二重ヘッドネットワークを用いて、正則化または事前処理を施した公平モデルの意思決定を再構築できるか?
- RQ4公平分類器の意思決定プロセスは、公平分類器と保護対象属性予測器の重み付き組み合わせと数学的に同等か?
- RQ5公平モデルにおける保護対象属性の暗黙的学習は、米国反差別法の下で差別的取り扱いに該当するか?
主な発見
- 公平性正則化および事前処理を施したモデルの内部表現は、公平性制約が強化されるにつれて、保護対象属性(人種や性別)の予測可能性が高まり、強い暗黙的学習が行われていることが示された。
- CelebAデータセットで訓練された公平モデルでは、個人の推定された性別や人種が異なっていた場合、最大35%の予測が変化する可能性があり、顕著な差別的取り扱いが示された。
- 提案された二重ヘッドアプローチは、高い忠実度で公平モデルを再構築でき、第二のヘッドの出力を用いて公平モデルから制約なし分類器を回復できる。
- 正則化または事前処理を施したモデルの意思決定は、提案された明示的二重ヘッド手法によって良好に近似可能であり、数学的同等性が示された。
- 公平モデルから、公平モデルの出力と第二のヘッドの予測を組み合わせることで、制約が非常に強い状況下でも制約なし分類器を回復できる。
- この手法により、公平モデルが推定された保護対象属性に基づいて系統的に個人を不利に扱っていることが判明し、米国法上、差別的取り扱いが行われていることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。