Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Active Preference Elicitation

Phebe Vayanos, Yingxiao Ye|arXiv (Cornell University)|2020. 03. 04.
Economic and Environmental Valuation인용 수 6
한 줄 요약

이 논문은 제한된 상호 쌍 비교 질의에서 고위험 의사결정 과정에서 최악의 경우 효용을 최대화하거나 최악의 경우의 회귀를 최소화하기 위해 조정 가능한 강건 최적화를 사용한 강건한 능동적 선호도 추론 방법을 제안한다. 오프라인 및 온라인 추론을 각각 두-and-반 단계 및 다단계 강건 최적화 문제로 공식화하며, 의사결정에 영향을 미치는 정보 발견이 의사결정에 의존함을 고려한다. 이는 합성 및 실세계의 실직자 주거 배정 데이터에서 최악의 경우의 회귀, 순위, 효용 측면에서 뛰어난 성능을 보였다.

ABSTRACT

We study the problem of eliciting the preferences of a decision-maker through a moderate number of pairwise comparison queries to make them a high quality recommendation for a specific problem. We are motivated by applications in high stakes domains, such as when choosing a policy for allocating scarce resources to satisfy basic needs (e.g., kidneys for transplantation or housing for those experiencing homelessness) where a consequential recommendation needs to be made from the (partially) elicited preferences. We model uncertainty in the preferences as being set based and} investigate two settings: a) an offline elicitation setting, where all queries are made at once, and b) an online elicitation setting, where queries are selected sequentially over time in an adaptive fashion. We propose robust optimization formulations of these problems which integrate the preference elicitation and recommendation phases with aim to either maximize worst-case utility or minimize worst-case regret, and study their complexity. For the offline case, where active preference elicitation takes the form of a two and half stage robust optimization problem with decision-dependent information discovery, we provide an equivalent reformulation in the form of a mixed-binary linear program which we solve via column-and-constraint generation. For the online setting, where active preference learning takes the form of a multi-stage robust optimization problem with decision-dependent information discovery, we propose a conservative solution approach. Numerical studies on synthetic data demonstrate that our methods outperform state-of-the art approaches from the literature in terms of worst-case rank, regret, and utility. We showcase how our methodology can be used to assist a homeless services agency in choosing a policy for allocating scarce housing resources of different types to people experiencing homelessness.

연구 동기 및 목표

  • 부분적인 선호도만 제공될 때, 희귀한 주거나 신장 자원을 배정하는 것과 같은 고위험 분야에서 고품질의 강건한 추천을 제공하는 데 도전한다.
  • 잠재적인 일관성 결여, 응답 오류, 모델 잘못 설정을 고려하기 위해 사용자 선호도의 불확실성을 집합 기반 불확실성 집합으로 모델링한다.
  • 선호도 추론과 추천을 하나의 강건 최적화 문제로 통합하여 최악의 상황에서도 성능 보장을 보장하는 통합 프레임워크를 개발한다.
  • 선호도 추론을 위한 오프라인(모든 질의를 사전에 선택) 및 온라인(적응형, 순차적 질의 선택) 설정을 모두 조사한다.
  • 사용자 응답이 일관되지 않거나 불완전한 경우에도 악성 응답에 강건하고 강력한 성능을 유지하도록 보장한다.

제안 방법

  • 의사결정에 영향을 미치는 정보 발견이 의존하는 두-and-반 단계 강건 최적화 문제로 오프라인 능동적 선호도 추론 문제를 공식화한다.
  • 열과 제약 조건 생성 기법을 사용하여 이 문제를 혼합정수선형계획문제로 재구성하여 정확하게 해결한다.
  • 온라인 능동적 선호도 추론 문제에 대해 보수적인 근사법을 제안하며, 의사결정에 의존하는 정보 발견이 포함된 다단계 강건 최적화 문제로 모델링한다.
  • 사용자 효용의 불확실성을 조정 가능한 강건 최적화를 통해 모델링하며, 명목 효용 벡터에서 유한한 편차를 가정한다.
  • 최악의 상황에서의 불확실성 수준을 제어하기 위해 강건성 매개변수 Γ를 도입하여 악성 응답에 강건한 추천을 보장한다.
  • 홈리스 관리정보시스템(HMIS)의 실세계 데이터를 적용하여 기관의 선호도를 기반으로 반사적 주거 배정 정책을 생성하고 평가한다.

실험 결과

연구 질문

  • RQ1사용자 응답이 일관되지 않거나 악성일 경우에도 최악의 경우 효용 또는 최악의 경우의 회귀를 보장하는 능동적 선호도 추론 시스템을 어떻게 설계할 수 있는가?
  • RQ2선호도의 불확실성을 집합 기반 불확실성 집합으로 모델링할 경우, 추천의 품질과 강건성에 어떤 영향을 미치는가?
  • RQ3제안된 강건 최적화 프레임워크는 합성 및 실세계 데이터에서 최악의 경우의 회귀, 순위, 효용 측면에서 최신 기술 대비 어떤 성능을 보이는가?
  • RQ4모델 잘못 설정(예: 응답 불일치의 표준편차에 대한 잘못된 가정)에 대해 추론의 강건성은 어느 정도 민감한가?
  • RQ5제안된 프레임워크는 실직자 경험자에게 희귀한 주거 자원을 배정하는 것과 같은 실세계 고위험 정책 문제에 효과적으로 적용될 수 있는가?

주요 결과

  • 제안된 방법은 합성 및 실세계 데이터 양쪽에서 최악의 경우의 회귀, 최악의 경우의 진짜 회귀, 최악의 경우의 진짜 순위 측면에서 최신 기술을 일관되게 뛰어넘는다.
  • 단 7개의 상호 쌍 비교 질의 이후, 응답 불일치가 있는 경우(σ = 0.025)에도 최악의 경우 순위가 6위 이내를 확보하며, 응답에 일관성이 없을 경우(σ = 0) 최상의 항목을 순위 매기는데 성공한다.
  • 모델 잘못 설정에 대해 뛰어난 강건성 보여줌: σ ≠ σ*일 경우 최악의 경우의 회귀 및 진짜 회귀는 오프라인에서 각각 0.03, 0.03, 온라인에서 각각 0.00, 0.01 감소한다.
  • 모델 잘못 설정 하에서 최악의 경우의 진짜 순위는 평균적으로 오프라인 2.44, 온라인 0.48 감소하여 매우 높은 내성성을 보여준다.
  • 온라인 보수적 근사법은 정확한 오프라인 해에 비해 거의 손실이 없이 거의 최적의 성능을 달성한다.
  • 프레임워크는 홈리스 서비스 기관의 선호도를 추론하여 공정성, 효율성, 해석 가능성의 균형을 맞춘 주거 배정 정책을 성공적으로 식별했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.