[論文レビュー] Fair Learning with Private Demographic Data
本稿では、局所的微分プライバシー(LDP)を用いた被差別的属性の学習フレームワークを提案し、感受性情報の暴露を防ぎつつ差別ののないモデルを実現する。2段階の学習アルゴリズムを導入し、プライベート属性統計の逆転によって予測誤差と公平性の両面で理論的保証を達成し、やや緩い条件下でも、元の属性とプライベート化された属性の間で差別ののない同等性を達成する。
Sensitive attributes such as race are rarely available to learners in real world settings as their collection is often restricted by laws and regulations. We give a scheme that allows individuals to release their sensitive information privately while still allowing any downstream entity to learn non-discriminatory predictors. We show how to adapt non-discriminatory learners to work with privatized protected attributes giving theoretical guarantees on performance. Finally, we highlight how the methodology could apply to learning fair predictors in settings where protected attributes are only available for a subset of the data.
研究の動機と目的
- 法的およびプライバシー制約下で、差別ののない機械学習を保証することと、感受性のある人種的属性データを保護することの間にある矛盾を解消すること。
- 下流の学習者が保護属性のローカルにプライベート化されたバージョンのみを用いて公平な予測器を学習できる手法を開発すること。
- プライベート属性に関する公平性が、元の感受性属性に関する公平性を意味する理論的条件を確立すること。
- 保護属性が完全に利用可能でない場合でも、誤差と差別の両面で統計的保証を持つ2段階の学習アルゴリズムを提供すること。
提案手法
- 感受性属性を局所的微分プライバシー(LDP)を用いてプライベート化することで、個人レベルのプライバシーを確保するとともに、公平性学習のための有効性を維持する。
- 元の $ A $ にアクセスせずに、唯一のプライベート化された属性 $ Z $ を用いて差別の度合いを測定する推定器を導入し、プライベート属性に基づく公平性監査を可能にする。
- 本質的なアルゴリズムは、$ Z $ の統計を逆転させることで元の $ A $ の性質を回復し、プライベート化されたデータから差別ののない予測器を構築可能にする。
- 2段階の学習手順を採用:まず、プライベートデータ上でベース予測器を学習し、次に、誤差を最小化しつつ公平性制約を満たすように、導出された予測器を最適化する。
- 理論的分析は、経験過程理論とラデマッハ複雑度を用い、誤差と差別のを高確率で有界化する。
- 保護属性がデータの一部に対してのみ利用可能な状況にも、統計的保証を持つ監査アルゴリズムを用いて拡張可能である。
実験結果
リサーチクエスチョン
- RQ1どのような条件下で、局所的にプライベート化された属性 $ Z $ に対する差別のなさが、元の感受性属性 $ A $ に対する差別のなさと同等になるか?
- RQ2保護属性が完全にプライベート化された状態でのみ利用可能な場合に、低誤差かつ低差別性を達成する学習アルゴリズムを設計可能か?理論的保証を伴う。
- RQ3プライバシー水準や仮説クラスの複雑さが、プライベート公平学習における公平性と誤差のトレードオフにどのように影響するか?
- RQ4保護属性が欠損している、または訓練データの一部に対してのみ利用可能な状況でも、提案手法が対応可能か?
- RQ5導出された予測器の統計的性能(誤差と差別性の観点)は、最適な公平予測器に対してどの程度の性能を示すか?
主な発見
- 本稿では、$ Z $ に関する公平性が $ A $ に関する公平性を意味する十分条件を確立し、プライバシー保護型公平性を実現可能であることを示した。
- 導出された予測器 $ \widetilde{Y} $ は、高確率で誤差バウンド $ \mathrm{err}(\widetilde{Y}) \leq_{\delta} \mathrm{err}(Y^{*}) + \frac{5C}{\min_{ya}\mathbf{P}_{ya}^{2}}\left(\frac{2}{B} + 10\mathfrak{R}_{\frac{\min_{ya}n\mathbf{P}_{ya}}{4}}(\mathcal{H}) + 18|\mathcal{A}|\sqrt{\frac{2\log{64|\mathcal{A}|/\delta}}{n\min_{ya}\mathbf{P}_{ya}}}\right) $ を達成する。
- 差別性は $ \mathrm{disc}(\widetilde{Y}) \leq_{\delta} \sqrt{\frac{\log(64/\delta)}{2n}} \cdot \frac{8|\mathcal{A}|C^{2}}{\min_{ya}\mathbf{P}_{ya}^{2}} $ で有界であり、サンプルサイズが大きくなるほど、またプライベート属性の分散が低くなるほど、公平性が向上することが示された。
- 本手法は、$ A $ と $ Z $ の間で差別ののない同等性を達成し、バイアスを低く見積もる代理変数ベースの公平性アプローチの落とし穴を回避する。
- 保護属性がデータの一部に対してのみ利用可能な場合、監査アルゴリズムは公平性に関する統計的保証を提供し、不完全な人種的属性情報でもバイアスの検出が可能になる。
- 理論的分析により、2段階のアルゴリズムが最適な公平予測器と同等の公平性と誤差性能を維持することが確認され、そのバウンドは仮説クラスの複雑さとデータ分布に依存する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。