Skip to main content
QUICK REVIEW

[論文レビュー] Fairness in Streaming Submodular Maximization: Algorithms and Hardness

Marwa El Halabi, Slobodan Mitrović|arXiv (Cornell University)|Oct 14, 2020
Complexity and Algorithms in Graphs参考文献 53被引用数 20
ひとこと要約

本稿では、基数制約および公平性制約の下で、公平なサブモジュラ最適化のための最初のストリーミング近似アルゴリズムを提示する。問題はマトロイド制約付きサブモジュラ最適化に還元される。単調関数に対してはO(k)のメモリで1/4-近似を達成し、非単調関数に対してはq/5.82-近似を達成する(qは超過比)。メモリのタイトな下界は、下界の結果を用いて証明されている。

ABSTRACT

Submodular maximization has become established as the method of choice for the task of selecting representative and diverse summaries of data. However, if datapoints have sensitive attributes such as gender or age, such machine learning algorithms, left unchecked, are known to exhibit bias: under- or over-representation of particular groups. This has made the design of fair machine learning algorithms increasingly important. In this work we address the question: Is it possible to create fair summaries for massive datasets? To this end, we develop the first streaming approximation algorithms for submodular maximization under fairness constraints, for both monotone and non-monotone functions. We validate our findings empirically on exemplar-based clustering, movie recommendation, DPP-based summarization, and maximum coverage in social networks, showing that fairness constraints do not significantly impact utility.

研究の動機と目的

  • 大規模データ環境下における、公平性制約のもとでの公平なサブモジュラ最適化のためのストリーミングアルゴリズムの欠如に対処すること。
  • 性別、人種、年齢などの感受性のある属性に関して、公平性を維持しつつ、効率的かつ低メモリの近似アルゴリズムを開発すること。
  • 公平性制約下での単調および非単調サブモジュラ関数に対して、タイトなメモリの下界と近似保証を確立すること。
  • 実世界の要約タスクにおいて、公平性制約が性能を著しく低下させないことを実証的に検証すること。

提案手法

  • 公平なサブモジュラ最適化をマトロイド制約付きサブモジュラ最適化に還元し、単調ケースでは近似比を保持する。
  • 分割マトロイド構造を用いた低メモリストリーミングアルゴリズムを設計し、O(k)のメモリで1/4-近似を達成し、要素1つあたりO(log k)の時間計算量を実現する。
  • 各グループごとの要素選択の柔軟性を定量化するための超過比 q = 1 - max_c(ℓ_c / |V_c|) の概念を導入する。
  • 確率的丸めとしきい値処理を活用し、O(k)のメモリを用いて非単調関数に対して q/5.82-近似アルゴリズムを提案する。
  • メモリの下界を証明する:q-近似より良い近似を達成する任意のアルゴリズムは、Ω(n)のメモリを必要とし、この下界がタイトであることを示す。
  • Fair-Streaming-CK および Fair-Streaming-FKK を実装し、SieveStreaming や UpperBounds などのベースラインと比較して評価する。

実験結果

リサーチクエスチョン

  • RQ1感受性のある属性(性別、人種、年齢など)の間でバランスの取れた表現を保ちながら、高い性能を維持する効率的なストリーミングアルゴリズムを設計することは可能か?
  • RQ2ストリーミングサブモジュラ最適化における公平性と性能のトレードオフは何か?また、超過比 q に応じてどのように変化するか?
  • RQ3公平性制約下のストリーミング設定において、サブ線形メモリで定数因子近似を達成することは可能か?
  • RQ4標準的なストリーミングベースラインと比較して、公平性制約はオракル呼び出し回数および実行時間にどのような影響を与えるか?

主な発見

  • 提案された Fair-Streaming-CK アルゴリズムは、O(k)のメモリと要素1つあたりO(log k)の時間計算量を用いて、単調サブモジュラ関数に対して1/4-近似を達成する。
  • 非単調関数に対しては、qは超過比であり、q/5.82-近似を達成する。この下界は定数因子の範囲でタイトである。
  • 非単調な公平なストリーミングサブモジュラ最適化において、q-近似より良い近似を達成する任意のアルゴリズムは、Ω(n)のメモリを必要とし、強いメモリの下界を示している。
  • 実証的結果から、公平な解は、非公平なベースラインの目的関数値の15%以内に収まり、Movielens や Pokec、Bank-Marketing などの実世界のデータセットで顕著なバイアスの低減が確認された。
  • SieveStreaming や UpperBounds などのベースラインは、公平性制約を著しく違反している—例として、最大被覆問題で150件の誤り、DPPに基づく要約で100件の誤りを示しており、明示的な公平性の強制が不可欠であることが示された。
  • 公平性のコストは小さい:性能損失は最小限(15%未満)であり、実際には公平性と高い性能が両立可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。