[論文レビュー] Holistic Survey of Privacy and Fairness in Machine Learning
本稿は、教師あり、教師なし、半教師あり、強化学習を含む機械学習全般におけるプライバシーと公平性に関する包括的で包括的なサーベイを提示する。プライバシーと公平性の相互作用を分析し、両方の目的を同時に最適化する既存のアーキテクチャおよびアルゴリズムをレビューし、特に大規模言語モデルにおけるユーティリティ損失を最小限に抑えるという点で、主な課題を特定する。
Privacy and fairness are two crucial pillars of responsible Artificial Intelligence (AI) and trustworthy Machine Learning (ML). Each objective has been independently studied in the literature with the aim of reducing utility loss in achieving them. Despite the significant interest attracted from both academia and industry, there remains an immediate demand for more in-depth research to unravel how these two objectives can be simultaneously integrated into ML models. As opposed to well-accepted trade-offs, i.e., privacy-utility and fairness-utility, the interrelation between privacy and fairness is not well-understood. While some works suggest a trade-off between the two objective functions, there are others that demonstrate the alignment of these functions in certain scenarios. To fill this research gap, we provide a thorough review of privacy and fairness in ML, including supervised, unsupervised, semi-supervised, and reinforcement learning. After examining and consolidating the literature on both objectives, we present a holistic survey on the impact of privacy on fairness, the impact of fairness on privacy, existing architectures, their interaction in application domains, and algorithms that aim to achieve both objectives while minimizing the utility sacrificed. Finally, we identify research challenges in achieving privacy and fairness concurrently in ML, particularly focusing on large language models.
研究の動機と目的
- 機械学習におけるプライバシーと公平性の関係を理解するという重要なギャップを埋めること、これは信頼性のあるAIにおける共通の役割にもかかわらず、依然として十分に調査されていない。
- プライバシーと公平性を統合する既存の手法を統合・分析すること、これは複数の学習パラダイムにわたる前処理、処理中、後処理技術を含む。
- プライバシーが公平性に与える影響と逆に、公平性がプライバシーに与える影響を検討し、さまざまな機械学習環境におけるトレードオフと一致の両方を同定すること。
- 特に大規模言語モデルにおいて、プライバシーと公平性が依然として深刻だが十分に調査されていない問題として残っている、未解決の研究課題を特定すること。
- 機械学習パイプラインで同時にプライバシーと公平性を達成しつつ、ユーティリティ損失を最小限に抑える統一されたフレームワークを提供すること。
提案手法
- プライバシーと公平性に関する150件以上の研究を体系的レビューし、前処理、処理中、後処理戦略に分類する。
- 処理中技術を、敵対的正則化子(例:保護属性不変性のための敵対的識別器)と公平性正則化子(例:バイアスフリーのグラフや反事実的公平性に基づく正則化)に分類する。
- 半教師あり学習(SSL)手法を分析し、ノード埋め込みが保護属性に対して不変になるように敵対的学習を用いるFairGNNを含む。
- AdaFair や Fair Boosting などの後処理技術を評価し、サンプルを再重み付けするか再サンプリングすることで、統計的同等性を確保し、グループ間の差を低減する。
- 保護属性を変更した反事実的ノード表現を生成・比較することで、グラフニューラルネットワークにおける反事実的公平性を実現するフレームワークを提案する。
- Benefit Ratio などの評価指標を統合し、SSLにおけるサブグループの精度向上を定量的に評価可能にする。

実験結果
リサーチクエスチョン
- RQ1プライバシーと公平性は機械学習においてどのように相互作用するのか。どのような状況で対立し、あるいは一致するのか。
- RQ2プライバシーと公平性を同時に最適化し、ユーティリティ損失を最小限に抑えるために、最も効果的なアーキテクチャとアルゴリズムは何か。
- RQ3前処理、処理中、後処理技術は、半教師あり学習や強化学習を含むさまざまな学習パラダイムにおいて、どのように機能するか。
- RQ4大規模言語モデルにおいて、プライバシーと公平性を同時に達成するにあたり、主な課題は何か。
- RQ5グラフベースおよびテーブル形式の機械学習モデルにおいて、プライバシー制約を課した際に、統計的同等性や等しいオッズといった公平性指標をどの程度維持できるか。
主な発見
- FairGNN などの GNN における敵対的正則化子は、保護属性に対するノード埋め込みの感受性を低下させることに成功しており、これは保護属性を予測するための識別器を訓練し、その精度を最小化することで実現される。
- バイアスフリーのグラフに基づく公平性正則化子は、学習済み埋め込みが公平性を保つ参照グラフから逸脱するのを効果的にペナルティ化し、ノード分類における統計的同等性を向上させる。
- AdaFair や Fair Boosting などの後処理技術は、誤分類されたサブグループの重みを動的に再調整し、サンプリングされた訓練セットにおける公平な代表性を確保することで、グループ差を低減する。
- 半教師あり学習においては、ベースライン精度が低いサブグループが偽ラベル付け後に性能が低下する傾向があることが判明し、不平等の拡大リスクが浮き彫りになった。
- Benefit Ratio 指標は、サブグループ間での正規化された精度向上を効果的に捉えており、高ベースライングループは SSL でより大きな利益を得るが、低ベースライングループは逆に不利になる可能性があることが明らかになった。
- 保護属性の変更を加えた反事実的表現を生成・比較するアプローチは、グラフベースのモデルで保護属性に対する不変性を達成する上で有望である。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。