Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Receiver Online Bayesian Persuasion

Matteo Castiglioni, Alberto Marchesi|arXiv (Cornell University)|Jun 11, 2021
Advanced Bandit Algorithms Research被引用数 6
ひとこと要約

本稿は、外部性のない二値行動をとる複数の受信者を対象とした、最初のオンラインベイジアンパーソージョンフレームワークを提示する。サブモodularな送信者利得関数に対して、近似射影オракルを用いたオンライン勾配降下法を用いて、多項式時間のno-(1−1/e)-regretアルゴリズムを提案する一方で、同様の制約下で、スーパーモジュラーまたは匿名の利得関数に対しては、多項式時間のno-α-regretアルゴリズムが存在しないことを証明する。

ABSTRACT

Bayesian persuasion studies how an informed sender should partially disclose information to influence the behavior of a self-interested receiver. Classical models make the stringent assumption that the sender knows the receiver's utility. This can be relaxed by considering an online learning framework in which the sender repeatedly faces a receiver of an unknown, adversarially selected type. We study, for the first time, an online Bayesian persuasion setting with multiple receivers. We focus on the case with no externalities and binary actions, as customary in offline models. Our goal is to design no-regret algorithms for the sender with polynomial per-iteration running time. First, we prove a negative result: for any $0 < α\leq 1$, there is no polynomial-time no-$α$-regret algorithm when the sender's utility function is supermodular or anonymous. Then, we focus on the case of submodular sender's utility functions and we show that, in this case, it is possible to design a polynomial-time no-$(1 - \frac{1}{e})$-regret algorithm. To do so, we introduce a general online gradient descent scheme to handle online learning problems with a finite number of possible loss functions. This requires the existence of an approximate projection oracle. We show that, in our setting, there exists one such projection oracle which can be implemented in polynomial time.

研究の動機と目的

  • 受信者タイプが敵対的に選ばれる状況における、オンラインベイジアンパーソージョンの複数受信者への拡張を目的とする。
  • 各イテレーションの実行時間が多項式時間であるような、送信者のno-α-regretアルゴリズムの設計を目的とする。
  • 送信者利得関数のクラス(スーパーモジュラー、サブモジュラー、匿名)ごとに、そのようなアルゴリズムの計算可能性を分析することを目的とする。
  • 直接信号プロファイルによって誘導されるマトロイド構造に対する多項式時間近似射影オラクルの存在を確立することを目的とする。
  • 複数受信者パーソージョンにおけるオンライン学習の根本的限界を特定し、スーパーモジュラーおよび匿名利得関数に対して否定的結果を示すこと。

提案手法

  • 各基底が有効なシグナリングスキームに対応する、直接信号プロファイル上のマトロイド構造を用いて、複数受信者パーソージョン問題を定式化する。
  • 送信者の期待利得を、マトロイド基底上で定義された非減少サブモジュラー関数と線形関数の和として表現する。
  • 有限個の損失関数が存在する状況下で、レジットを最小化するためのオンライン勾配降下法を適用し、近似射影オラクルに依存する。
  • マトロイド構造に対して多項式時間で計算可能な、新規の近似射影オラクルを導入し、効率的なオンライン更新を可能にする。
  • Sviridenkoら(2017)のアルゴリズムを用いて、マトロイド制約下でのサブモジュラー利得最大化において、期待値で(1−1/e)-近似を達成する。
  • 完全情報フィードバックを採用し、各イテレーション後に各受信者のタイプを観測することで、適応的シグナリングが可能になる。

実験結果

リサーチクエスチョン

  • RQ1各イテレーションの実行時間が多項式時間であるような、複数受信者オンラインベイジアンパーソージョンにおけるno-α-regretアルゴリズムを設計できるか?
  • RQ2送信者の利得関数がスーパーモジュラーや匿名的である場合、そのようなアルゴリズムの計算的制限は何か?
  • RQ3送信者の利得関数がサブモジュラーである場合、定数倍のレジット保証(特に1−1/e)を達成することは可能か?
  • RQ4複数受信者パーソージョンにおける直接信号プロファイルによって誘導されるマトロイド構造に対して、効率的な近似射影オラクルは存在するか?
  • RQ5この設定において、有限個の損失関数を持つオンライン学習問題に、オンライン勾配降下法を効果的に適応できるか?

主な発見

  • 任意の0 < α ≤ 1に対して、送信者の利得関数がスーパーモジュラーまたは匿名的である場合、多項式時間のno-α-regretアルゴリズムは存在しない。
  • 送信者の利得関数がサブモジュラーである場合、多項式時間のno-(1−1/e)-regretアルゴリズムが存在し、最良のイン・ハイデンシングシグナリングスキームの(1−1/e)-近似を達成する。
  • マトロイド構造に対する効率的な近似射影オラクルの存在が、この設定におけるオンライン勾配降下法の適用を可能にする。
  • アルゴリズムは、問題インスタンスのサイズおよび逆精度パラメータに関して多項式時間で、高い確率でレジット保証を達成する。
  • 完全情報フィードバックと固定された受信者タイプ数の下で、計算的実行可能性が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。