Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Receiver Online Bayesian Persuasion

Matteo Castiglioni, Alberto Marchesi|arXiv (Cornell University)|2021. 06. 11.
Advanced Bandit Algorithms Research인용 수 6
한 줄 요약

이 논문은 외부 효과가 없고 이진 행동을 취하는 다수의 수신자에 대한 온라인 베이지안 선전 프레임워크를 처음으로 제안한다. 하위모듈러성(sender utility) 함수를 가진 경우, 근사 사영 오라클을 사용하는 온라인 경사 하강법을 통해 다항 시간 내에 no-(1−1/e)-regret 알고리즘을 제안하며, 동일한 조건 하에서 초모듈러성 또는 익명성 utility 함수에 대해 다항 시간 내에 no-α-regret 알고리즘이 존재하지 않음을 증명한다.

ABSTRACT

Bayesian persuasion studies how an informed sender should partially disclose information to influence the behavior of a self-interested receiver. Classical models make the stringent assumption that the sender knows the receiver's utility. This can be relaxed by considering an online learning framework in which the sender repeatedly faces a receiver of an unknown, adversarially selected type. We study, for the first time, an online Bayesian persuasion setting with multiple receivers. We focus on the case with no externalities and binary actions, as customary in offline models. Our goal is to design no-regret algorithms for the sender with polynomial per-iteration running time. First, we prove a negative result: for any $0 < α\leq 1$, there is no polynomial-time no-$α$-regret algorithm when the sender's utility function is supermodular or anonymous. Then, we focus on the case of submodular sender's utility functions and we show that, in this case, it is possible to design a polynomial-time no-$(1 - \frac{1}{e})$-regret algorithm. To do so, we introduce a general online gradient descent scheme to handle online learning problems with a finite number of possible loss functions. This requires the existence of an approximate projection oracle. We show that, in our setting, there exists one such projection oracle which can be implemented in polynomial time.

연구 동기 및 목표

  • 수신자 유형이 적대적으로 선택된 상황에서 온라인 베이지안 선전을 다수 수신자 환경으로 확장하기.
  • 각 반복 단계에서 다항 시간 복잡도를 가지는 송신자에 대한 no-α-regret 알고리즘 설계.
  • 초모듈러성, 하위모듈러성, 익명성 등의 다른 송신자 utility 함수 유형에 대해 이러한 알고리즘의 계산 가능성 분석.
  • 직접 신호 프로파일에 의해 유도되는 매트로이드 구조에 대해 다항 시간 내에 계산 가능한 근사 사영 오라클의 존재를 입증.
  • 다수 수신자 선전에서 온라인 학습의 근본적 한계를 규명하며, 초모듈러성 및 익명성 utility 함수에 대해 부정적인 결과 도출.

제안 방법

  • 각 기저가 유효한 신호 전략에 대응하는 직접 신호 프로파일에 대한 매트로이드 구조를 사용해 다수 수신자 선전 문제를 수식화.
  • 송신자의 기대 효용을 매트로이드 기저 위에서 비감소 하위모듈러 함수와 선형 함수의 합으로 표현.
  • 유한한 손실 함수 집합이 존재하는 상황에서 회귀를 최소화하기 위해 온라인 경사 하강법을 적용하며, 이는 근사 사영 오라클에 의존.
  • 매트로이드 구조에 대해 다항 시간 내에 계산 가능한 새로운 근사 사영 오라클을 도입하여 효율적인 온라인 업데이트 가능.
  • Sviridenko 등 (2017)의 알고리즘을 사용해 매트로이드 제약 조건 하에서 하위모듈러성 효용 최대화 문제에 대해 기대값에서 (1−1/e)-근사값 달성.
  • 전체 정보 피드백을 활용하며, 각 반복 후 수신자의 유형을 관측함으로써 적응형 신호 전략 가능.

실험 결과

연구 질문

  • RQ1각 반복 단계에서 다항 시간 복잡도를 가지는 다수 수신자 온라인 베이지안 선전에 대해 no-α-regret 알고리즘을 설계할 수 있는가?
  • RQ2송신자의 효용이 초모듈러성 또는 익명성일 경우, 이러한 알고리즘의 계산적 제약은 무엇인가?
  • RQ3송신자의 효용이 하위모듈러성일 경우, 일정 요율의 회귀 보장을 달성할 수 있는가 (특히 1−1/e)?
  • RQ4다수 수신자 선전에서 직접 신호 프로파일에 의해 유도되는 매트로이드 구조에 대해 효율적인 근사 사영 오라클이 존재하는가?
  • RQ5이 설정에서 손실 함수가 유한한 수인 온라인 학습 문제에 대해 온라인 경사 하강법을 효과적으로 적용할 수 있는가?

주요 결과

  • 모든 0 < α ≤ 1에 대해, 송신자의 효용이 초모듈러성 또는 익명성일 경우 다항 시간 내에 no-α-regret 알고리즘이 존재하지 않는다.
  • 송신자의 효용이 하위모듈러성일 경우, 다항 시간 내에 no-(1−1/e)-regret 알고리즘이 존재하며, 최적의 이전 신호 전략에 대해 (1−1/e)-근사값을 달성한다.
  • 매트로이드 구조에 대해 효율적인 근사 사영 오라클의 존재는 이 설정에서 온라인 경사 하강법의 적용 가능성을 보장한다.
  • 알고리즘은 문제 인스턴스 크기와 정확도 역수 파라미터에 대해 다항 시간 내에 높은 확률로 회귀 보장을 달성한다.
  • 전체 정보 피드백과 고정된 수의 수신자 유형 조건 하에서 결과가 성립하여 계산의 타당성이 보장된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.