Skip to main content
QUICK REVIEW

[論文レビュー] Robust Active Preference Elicitation

Phebe Vayanos, Yingxiao Ye|arXiv (Cornell University)|Mar 4, 2020
Economic and Environmental Valuation被引用数 6
ひとこと要約

本稿では、限られたペアワイズクエリの制約下で、高リスク意思決定における最悪ケース効用の最大化または最悪ケースの後悔の最小化を目的として、調整可能ロバスト最適化を用いたロバストでアクティブな好みの特定手法を提案する。オフラインおよびオンラインの好みの特定を、それぞれ2.5段階およびマルチ段階のロバスト最適化問題として定式化し、意思決定に依存する情報発見を組み込む。合成データおよび実世界のホームレス住宅割り当てデータにおいて、最悪ケースの後悔、ランク、および効用の観点で優れた性能を示した。

ABSTRACT

We study the problem of eliciting the preferences of a decision-maker through a moderate number of pairwise comparison queries to make them a high quality recommendation for a specific problem. We are motivated by applications in high stakes domains, such as when choosing a policy for allocating scarce resources to satisfy basic needs (e.g., kidneys for transplantation or housing for those experiencing homelessness) where a consequential recommendation needs to be made from the (partially) elicited preferences. We model uncertainty in the preferences as being set based and} investigate two settings: a) an offline elicitation setting, where all queries are made at once, and b) an online elicitation setting, where queries are selected sequentially over time in an adaptive fashion. We propose robust optimization formulations of these problems which integrate the preference elicitation and recommendation phases with aim to either maximize worst-case utility or minimize worst-case regret, and study their complexity. For the offline case, where active preference elicitation takes the form of a two and half stage robust optimization problem with decision-dependent information discovery, we provide an equivalent reformulation in the form of a mixed-binary linear program which we solve via column-and-constraint generation. For the online setting, where active preference learning takes the form of a multi-stage robust optimization problem with decision-dependent information discovery, we propose a conservative solution approach. Numerical studies on synthetic data demonstrate that our methods outperform state-of-the art approaches from the literature in terms of worst-case rank, regret, and utility. We showcase how our methodology can be used to assist a homeless services agency in choosing a policy for allocating scarce housing resources of different types to people experiencing homelessness.

研究の動機と目的

  • 限られた好みの情報しか得られない状況において、希少な住宅や腎臓の割り当てといった高リスク分野で、高品質でロバストな推薦を提供する課題に対処すること。
  • 潜在的な一貫性の欠如、応答エラー、モデルの誤指定を考慮するため、好みの不確実性を集合ベースの不確実性集合としてモデル化すること。
  • 好みの特定と推薦を統合した一貫したフレームワークを構築し、最悪ケースのシナリオにおいても性能保証が得られるように、1つのロバスト最適化問題に統合すること。
  • 好みの特定におけるオフライン(事前にすべてのクエリを選択)およびオンライン(適応的・逐次的なクエリ選択)の両方の設定を調査すること。
  • ユーザーの応答が一貫性のない場合や不完全な場合でも、悪意のある応答に対して耐性を持ち、強力な性能を維持できるようにすること。

提案手法

  • 意思決定に依存する情報発見を伴う2.5段階のロバスト最適化問題として、オフラインのアクティブな好みの特定問題を定式化し、クエリ選択が将来の情報可用性に影響を与えることを考慮する。
  • 列と制約の生成法を用いて、オフライン問題を混合整数線形計画問題に再定式化し、正確な解法を実現する。
  • オンラインのアクティブな好みの特定問題に対して、保守的な近似を提案し、意思決定に依存する情報発見を伴うマルチ段階のロバスト最適化問題としてモデル化する。
  • 調整可能ロバスト最適化を用いて、ユーザーの効用における不確実性をモデル化し、名目効用ベクトルからの有界な偏差を仮定する。
  • 最悪ケースのシナリオにおける不確実性の程度を制御するためのロバストネスパラメータΓを導入し、悪意のある応答に対しても耐性を持つようにする。
  • ホームレス管理情報システム(HMIS)の実世界データを用いて、機関の好みに基づく反事実的住宅割り当て政策の生成と評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1ユーザーの応答が一貫性のない場合や悪意のある場合でも、最悪ケースの効用または後悔を考慮したロバストな推薦を保証するアクティブな好みの特定システムをどのように設計できるか?
  • RQ2好みの不確実性を集合ベースの不確実性集合としてモデル化することは、推薦の質とロバストネスにどのような影響を与えるか?
  • RQ3提案されたロバスト最適化フレームワークは、合成データおよび実世界データにおいて、最悪ケースの後悔、ランク、および効用の観点で、最先端の手法と比較してどのように性能を発揮するか?
  • RQ4モデルの誤指定、例えば応答の一貫性の標準偏差に関する誤った仮定が、クエリ選択法のロバストネスにどの程度影響を与えるか?
  • RQ5提案されたフレームワークは、ホームレスの支援を受ける人々に希少な住宅資源を割り当てるといった、実世界の高リスク政策課題に効果的に適用可能か?

主な発見

  • 提案手法は、合成データおよび実世界データの両方において、最先端の手法を最悪ケースの後悔、最悪ケースの真の後悔、最悪ケースの真のランクの観点で一貫して上回った。
  • わずか7回のペアワイズクエリで、応答の一貫性の欠如(σ = 0.025)下でも最悪ケースのランクが6位以下に達し、応答に一貫性がない場合(σ = 0)には最良のアイテムを正しくランク付けした。
  • モデルの誤指定に対しても高いロバストネスを示した:σ ≠ σ* の場合、最悪ケースの後悔と真の後悔は、オフラインでそれぞれ0.03と0.03、オンラインでそれぞれ0.00と0.01の低下にとどまった。
  • モデルの誤指定下での最悪ケースの真のランクは、平均でオフラインで2.44、オンラインで0.48低下したが、これは高い耐性を示している。
  • オンラインの保守的近似アプローチは、正確なオフライン解と比較して最小限の損失で近似的に最適な性能を達成した。
  • フレームワークは、ホームレス支援機関の好みから得られた情報を基に、公平性、効率性、解釈可能性をバランスさせた住宅割り当て政策を効果的に同定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。