Skip to main content
QUICK REVIEW

[論文レビュー] Online and Customizable Fairness-aware Learning

Wenbin Zhang|arXiv (Cornell University)|Oct 15, 2020
Data Stream Mining Techniques参考文献 33被引用数 8
ひとこと要約

本稿では、非定常なデータストリームに動的に適応可能な公平性に配慮した分割基準を備えたオンライン意思決定木フレームワーク、FAHTおよび2CFAHTを提案する。これらの手法は、公平性と精度の間で細かく調整可能なトレードオフを実現し、ベースラインモデルに比べて差別的行動を最大60%低減する。2CFAHTはAdultデータセットで公平性違反を41.75%、Censusデータセットで60.0%低減した一方で、高い予測精度を維持している。

ABSTRACT

While artificial intelligence (AI)-based decision-making systems are increasingly popular, significant concerns on the potential discrimination during the AI decision-making process have been observed. For example, the distribution of predictions is usually biased and dependents on the sensitive attributes (e.g., gender and ethnicity). Numerous approaches have therefore been proposed to develop decision-making systems that are discrimination-conscious by-design, which are typically batch-based and require the simultaneous availability of all the training data for model learning. However, in the real-world, the data streams usually come on the fly which requires the model to process each input data once ``on arrival'' and without the need for storage and reprocessing. In addition, the data streams might also evolve over time, which further requires the model to be able to simultaneously adapt to non-stationary data distributions and time-evolving bias patterns, with an effective and robust trade-off between accuracy and fairness. In this paper, we propose a novel framework of online decision tree with fairness in the data stream with possible distribution drifting. Specifically, first, we propose two novel fairness splitting criteria that encode the data as well as possible, while simultaneously removing dependence on the sensitive attributes, and further adapts to non-stationary distribution with fine-grained control when needed. Second, we propose two fairness decision tree online growth algorithms that fulfills different online fair decision-making requirements. Our experiments show that our algorithms are able to deal with discrimination in massive and non-stationary streaming environments, with a better trade-off between fairness and predictive performance.

研究の動機と目的

  • データが継続的に到着し、分布が変化するオンラインでストリーミングされるデータ環境における公平性に配慮した学習の欠如に対処すること。
  • リアルタイムで差別的行動の緩和、コンセプトドリフト、カスタマイズ可能な公平性-精度トレードオフを同時に処理できるフレームワークを構築すること。
  • 非ステーションナリィな状況下でも、感受性属性に依存しない形でデータを効果的に表現する分割基準を設計すること。
  • 調整可能なパラメータγを通じて、パフォーマンス制約下でのビジネスニーズに応じたアプリケーション固有の公平性制御を可能にすること。
  • 履歴データの保存を避け、バッチ再処理を不要とするスケーラブルでオンラインのソリューションを提供すること。

提案手法

  • 定常ストリーム用(FAHT)と非定常ストリーム用(2CFAHT)の2つの公平性に配慮した分割基準を提案。
  • AFIG(適応的公平性情報ゲイン)を導入。これは、データの符号化と差別の排除のバランスを保ちながら、進化するデータ分布に適応する新しい公平性に配慮した情報ゲイン指標である。
  • 2CFAHTでは、コンセプトドリフト検出とフォーゲティングメカニズムを採用し、分布のシフト下でもモデルの関連性と公平性を維持する。
  • 公平性と精度のトレードオフを制御する調整可能なハイパーパrameter γ を使用。異なるアプリケーション文脈に応じた細かいつながりのカスタマイズを可能にする。
  • McNemar検定と統計的分析を用いて、実世界のデータセットにおける公平性と分類性能の向上を検証。
  • 各データインスタンスが到着した時点で一度きり処理するオンライン木成長戦略を採用。これにより、保存や再処理の必要がなくなる。

実験結果

リサーチクエスチョン

  • RQ1継続的に到着するデータと進化する分布を伴うオンラインストリーミング環境において、公平性に配慮した意思決定木を効果的に拡張できるか?
  • RQ2コンセプトドリフトに動的に適応しつつ、リアルタイムで公平性と予測精度を同時に最適化できるか?
  • RQ3調整可能なパラメータγにより、オンライン学習におけるカスタマイズ可能なアプリケーション固有の公平性-精度トレードオフを実現できるか?
  • RQ4適応的公平性基準は、非定常なデータストリームにおいて、高いモデル精度を維持しつつ差別的行動をどの程度低減できるか?
  • RQ5ストリーミング環境下で、バッチベースの公平性手法と比較して、本フレームワークは公平性の低減とモデルの複雑さの両面で優れているか?

主な発見

  • 2CFAHTは、ベースライン手法と比較してAdultデータセットで41.75%、Censusデータセットで60.0%の差別的行動を低減したが、精度の損失は最小限に抑えられた。
  • AFIG基準は、Censusデータセットで差別的行動を28.1%、Adultデータセットで6.86%低減した。
  • 2CFAHTはCensusデータセットで95.03%の高い精度を維持しながら、公平性違反を0.88%まで低減した。FAHT(3.63%の差別的行動)と2CFAHT-(2.20%)を上回った。
  • McNemar検定により、劣位なグループの陽性分類の向上が統計的に有意であることが確認され、Censusデータセットではp値が2.2e-16未満であった。
  • FAHTは2CFAHTに比べてモデルの複雑さが低く、メモリオーバーヘッドが少ないため、定常的または安定したデータ環境に適している。
  • フレームワークはγを介して細かいつながりの公平性制御を実現でき、γを小さくすることで精度を高めるが公平性を犠牲にする傾向を示しており、カスタマイズ可能なトレードオフを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。