[論文レビュー] Dikaios: Privacy Auditing of Algorithmic Fairness via Attribute Inference Attacks
Dikaios は、機械学習における処理内公平性アルゴリズムのプライバシーリスクを評価するために、適応的閾値に基づく属性推定攻撃を用いるプライバシー監査ツールである。この研究では、公平性メカニズムがクラス不均衡の下で予測不能に属性漏洩を増加させることを明らかにし、信頼できるAI設計における信頼性を損なう要因となっていることが示された。
Machine learning (ML) models have been deployed for high-stakes applications. Due to class imbalance in the sensitive attribute observed in the datasets, ML models are unfair on minority subgroups identified by a sensitive attribute, such as race and sex. In-processing fairness algorithms ensure model predictions are independent of sensitive attribute. Furthermore, ML models are vulnerable to attribute inference attacks where an adversary can identify the values of sensitive attribute by exploiting their distinguishable model predictions. Despite privacy and fairness being important pillars of trustworthy ML, the privacy risk introduced by fairness algorithms with respect to attribute leakage has not been studied. We identify attribute inference attacks as an effective measure for auditing blackbox fairness algorithms to enable model builder to account for privacy and fairness in the model design. We proposed Dikaios, a privacy auditing tool for fairness algorithms for model builders which leveraged a new effective attribute inference attack that account for the class imbalance in sensitive attributes through an adaptive prediction threshold. We evaluated Dikaios to perform a privacy audit of two in-processing fairness algorithms over five datasets. We show that our attribute inference attacks with adaptive prediction threshold significantly outperform prior attacks. We highlighted the limitations of in-processing fairness algorithms to ensure indistinguishable predictions across different values of sensitive attributes. Indeed, the attribute privacy risk of these in-processing fairness schemes is highly variable according to the proportion of the sensitive attributes in the dataset. This unpredictable effect of fairness mechanisms on the attribute privacy risk is an important limitation on their utilization which has to be accounted by the model builder.
研究の動機と目的
- 処理内公平性アルゴリズムが属性プライバシー漏洩にどのように影響するかを理解する空白を埋めること。
- 感受性属性におけるクラス不均衡が、公平性メカニズムが意図せずプライバシーリスクを増加させることを特定すること。
- モデル開発者が公平性アルゴリズムのプライバシー的影響を評価できる実用的な監査ツールを開発すること。
- 現実のデータ不均衡下で、既存の属性推定攻撃が公平性アルゴリズムの評価に不十分であることを示すこと。
提案手法
- 感受性属性におけるクラス不均衡を反映するために、属性推定攻撃に適応的予測閾値を提案する。
- モデルの予測を利用して感受性属性を推定するブラックボックス監査ツールとして Dikaios を設計する。
- 不均衡下でのモデルの予測分布に一致させる閾値適応戦略を採用し、推定精度を向上させる。
- 5つの実世界データセットを用いて2つの処理内公平性アルゴリズムに対して攻撃を評価し、プライバシー漏洩を測定する。
- 公平性アルゴリズムが感受性属性グループ間で区別不能な予測を達成しているかどうかを、攻撃を用いて評価する。
- プライバシー監査をモデル開発ライフサイクルに統合し、プライバシーに配慮した公平性設計を支援する。
実験結果
リサーチクエスチョン
- RQ1提案された適応的閾値に基づく属性推定攻撃は、公平性に配慮したモデルにおけるプライバシー漏洩をどの程度効果的に暴露できるか?
- RQ2感受性属性におけるクラス不均衡が、処理内公平性アルゴリズムのプライバシーリスクにどの程度影響を及ぼすか?
- RQ3既存の属性推定攻撃は、ブラックボックスモデルにおける公平性メカニズムのプライバシー的影響を信頼性を持って監査できるか?
- RQ4感受性属性の分布が異なるさまざまなデータセットにおいて、公平性アルゴリズムのプライバシーリスクはどのように変動するか?
- RQ5現実のデータ条件下で、処理内公平性アルゴリズムが属性プライバシーを保護する点での限界は何か?
主な発見
- 適応的閾値に基づく属性推定攻撃は、クラス不均衡下で感受性属性を推定する際、従来の攻撃を著しく上回る性能を示した。
- 処理内公平性アルゴリズムは、マイノリティグループが代表されていない場合、感受性属性グループ間での予測が区別不能であることを保証できない。
- 公平性アルゴリズムが引き起こすプライバシーリスクは、データセットにおける感受性属性の割合に応じて著しく変動し、予測不能である。
- モデル開発者は、公平性アルゴリズムが属性プライバシーを保護すると一概に信頼できない。同じアルゴリズムでも、あるデータセットでは他のデータセットよりも多くの感受性情報を漏洩させる可能性がある。
- 本研究では、公平性とプライバシーの間で重要なトレードオフが存在することが明らかになった。公平性メカニズムは、マイノリティサブグループにおいて意図せずプライバシー漏洩を増加させる可能性がある。
- Dikaios は、モデル開発者が公平性に配慮したモデルを導入する前に、事前にプライバシーリスクを検出・緩和できる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。