QUICK REVIEW
[論文レビュー] A Central Limit Theorem for $L_p$ transportation cost with applications to Fairness Assessment in Machine Learning
Eustasio del Barrio, Paula Gordaliza|arXiv (Cornell University)|Jul 18, 2018
Adversarial Robustness in Machine Learning参考文献 18被引用数 3
ひとこと要約
本稿は、実数直線上の経験的分布間の$L_p$- Wasserstein距離について、最小限のモーメントおよび滑らかさの仮定の下で中心極限定理(CLT)を確立する。これにより、分布の類似性を検証する漸近的に有効な2標本検定が可能となり、保護されたサブグループ間の分類器出力の Wasserstein 距離を測定することにより、機械学習における新しい公平性評価基準が導入される。
ABSTRACT
We provide a Central Limit Theorem for the Monge-Kantorovich distance between two empirical distributions with size $n$ and $m$, $W_p(P_n,Q_m)$ for $p>1$ for observations on the real line, using a minimal amount of assumptions. We provide an estimate of the asymptotic variance which enables to build a two sample test to assess the similarity between two distributions. This test is then used to provide a new criterion to assess the notion of fairness of a classification algorithm.
研究の動機と目的
- 基礎となる分布に最小限の仮定をおくことで、2つの経験的分布間の$L_p$-Wasserstein距離$W_p(P_n, Q_m)$に対する中心極限定理(CLT)を確立すること。
- 分布類似性の2標本仮説検定を構築するために、$W_p(P_n, Q_m)$の漸近的分散の推定を導出すること。
- 理論的CLTを応用して、保護されたサブグループ間の分類器出力の Wasserstein 距離を測定することにより、機械学習モデルの公平性を評価する新しい分布フリーな基準を提案すること。
- 独立性や条件付き独立性の仮定に依存せず、最適輸送距離を用いてバイアスを定量化する、公平性評価の厳密な統計的基盤を提供すること。
提案手法
- 累積分布関数に最小限のモーメントおよび滑らかさ条件を課したもとで、標本サイズが$n$および$m$である経験的測度$P_n$および$Q_m$間の$L_p$-Wasserstein距離$W_p(P_n, Q_m)$の漸近的分布を導出する。
- Wasserstein距離の$p$乗のテイラー展開を用い、経験的分位数過程の弱収束結果を適用することで、極限正規分布を導出する。
- 正規化された$W_p^p$距離の分布収束を正規分布に示し、逆累積分布関数およびそれらの差分を用いて漸近的分散の明示的表現を導出する。
- CLTを用いて、帰無仮説$\mathcal{W}_p(P,Q) \geq \Delta_0$ 対 対立仮説$\mathcal{W}_p(P,Q) < \Delta_0$ の2標本検定を構築し、推定された漸近的分散を用いる。
- 保護された属性$S=0$および$S=1$におけるモデル予測の条件付き分布間の Wasserstein 距離に基づく機械学習における公平性指標を提案する。
- 理論的CLTを用いて公平性指標の推論を正当化し、観測された乖離の統計的有意性を評価するためのp値および信頼区間を可能にする。
実験結果
リサーチクエスチョン
- RQ1実数直線上の2つの経験的分布間の$L_p$-Wasserstein距離が、中心極限定理を満たすために必要な最小限の正則性条件は何か?
- RQ2弱いモーメントおよび滑らかさの仮定の下で、$W_p(P_n, Q_m)$統計量の漸近的分散を一貫して推定できるか?
- RQ3$W_p(P_n, Q_m)$のCLTをどのように活用して、分布類似性の有効な2標本検定を構築できるか?
- RQ4保護されたサブグループ間の分類器出力の Wasserstein 距離は、機械学習における統計的に解釈可能な公平性指標としてどの程度有効か?
- RQ5経験的分布と真の分布間の$W_p^p$距離の期待値の漸近的挙動は何か?また、極限正規分布とはどのように関係するか?
主な発見
- 本稿は、最小限の仮定の下で、$\sqrt{n}(W_p^p(F_n, G) - W_p^p(F, G))$が、平均が0で明確に定義された漸近的分散を持つ正規確率変数に分布収束することを確立する。
- $W_p^p$距離の漸近的分散は、基礎となる分布の逆累積分布関数およびそれらの差分を用いて明示的に導出される。
- CLTは、$p$次のモーメント条件および累積分布関数のやや滑らかさの条件下でのみ成立し、従来の結果が要求する高階のモーメントよりも優れている。
- 極限分布として$W_p(P_n, Q_m)$は漸近的に正規分布に従い、分布類似性のための信頼区間および仮説検定の構築が可能になる。
- 期待値$W_p^p(F_n, G)$は$W_p^p(F, G)$に$O(1/\sqrt{n})$の速度で収束し、中心化された系列は正規分布に分布収束する。
- 提案された公平性評価フレームワークは、保護群と非保護群のモデル出力間の Wasserstein 距離をバイアスの定量化に用い、導出されたCLTにより統計的推論が可能になる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。