Skip to main content
QUICK REVIEW

[論文レビュー] A Multi-Agent Reinforcement Learning Method for Impression Allocation in Online Display Advertising

Di Wu, Cheng Chen|arXiv (Cornell University)|Sep 10, 2018
Auction Theory and Applications参考文献 23被引用数 9
ひとこと要約

本稿では、不安定な環境下でも出版者の収益を最大化するため、保証契約をリアルタイムオークションにおける入札エージェントとして扱う多エージェント強化学習手法MAPOLOを提案する。この手法は、保証契約とRTBの間でインプレッションを最適に割り当てることを目的とし、SOTAのマルチエージェント強化学習手法と比較して収束が早く、スケーラビリティに優れる。大規模データセット上でも、10,000秒未満で最適収益の90%に到達する。

ABSTRACT

In online display advertising, guaranteed contracts and real-time bidding (RTB) are two major ways to sell impressions for a publisher. Despite the increasing popularity of RTB, there is still half of online display advertising revenue generated from guaranteed contracts. Therefore, simultaneously selling impressions through both guaranteed contracts and RTB is a straightforward choice for a publisher to maximize its yield. However, deriving the optimal strategy to allocate impressions is not a trivial task, especially when the environment is unstable in real-world applications. In this paper, we formulate the impression allocation problem as an auction problem where each contract can submit virtual bids for individual impressions. With this formulation, we derive the optimal impression allocation strategy by solving the optimal bidding functions for contracts. Since the bids from contracts are decided by the publisher, we propose a multi-agent reinforcement learning (MARL) approach to derive cooperative policies for the publisher to maximize its yield in an unstable environment. The proposed approach also resolves the common challenges in MARL such as input dimension explosion, reward credit assignment, and non-stationary environment. Experimental evaluations on large-scale real datasets demonstrate the effectiveness of our approach.

研究の動機と目的

  • 不安定で変動しやすい広告環境下において、保証契約とリアルタイム入札(RTB)の間での最適なインプレッション割り当てを実現すること。
  • 契約の履行、RTB収益、ペナルティ回避を統合最適化することで、出版者の収益を最大化すること。
  • 入力次元の爆発、報酬の帰属割り当て、非定常的環境といった一般的な課題を克服できる、スケーラブルで効率的なマルチエージェント強化学習フレームワークを構築すること。
  • 保証契約を最適入札関数を持つ仮想入札者としてモデル化することで、保証契約がリアルタイムオークションに参加可能になるようにすること。

提案手法

  • 各保証契約が個々のインプレッションに対して仮想入札を提出するオークション問題としてインプレッション割り当てを定式化する。
  • ゲーム理論的分析を用いて、最適な割り当て戦略を保証するための、契約の最適入札関数を導出する。
  • MADDPGに基づく、集中学習・分散実行のマルチエージェント強化学習フレームワークであるMAPOLOを提案。非定常性を低減するための新規報酬関数を導入する。
  • 出版者の総収益を直接反映する報酬関数(式6)を導入し、帰属割り当てと収束性を向上させる。
  • エージェント数の増加に対しても低次元の入力表現を維持するように設計し、スケーラビリティを向上させる。
  • 集中型クライアントを採用することで、契約入札者の行動を統合最適化し、ポリシーの調整を可能にする。

実験結果

リサーチクエスチョン

  • RQ1保証契約をリアルタイムオークションに効果的に統合することで、インプレッション割り当ての効率性と出版者の収益をどのように向上させられるか?
  • RQ2変動しやすい環境下でRTBと競合する際、保証契約の最適入札戦略は何か?
  • RQ3大規模広告システムにおける入力次元の爆発、報酬の帰属割り当て、非定常的環境に対処できるように、マルチエージェント強化学習手法をどのように設計できるか?
  • RQ4集中学習・分散実行フレームワークは、インプレッション割り当てにおいて、既存のマルチエージェント強化学習手法よりも収束速度とスケーラビリティで優れているか?
  • RQ5提案された報酬関数は、非定常的広告環境下での学習安定性と収束性にどのような影響を与えるか?

主な発見

  • MAPOLOは、出版者1(68エージェント)および出版者3(25エージェント)のデータセット上において、10,000秒以内に最適収益の90%($R/R^* = 0.9$)に収束する。
  • MAPOLOはMADDPGに比べて著しく収束が速く、エージェント数が2.7倍に増加した際の1エピソードあたりの時間は2.5倍に増加するが、MADDPGでは4.7倍に増加する。
  • MAPOLOで提案された報酬関数は非定常性の影響を軽減し、より安定的かつ効率的な学習を実現する。
  • 契約数に関わらず、MAPOLOはエージェント1人あたりの入力次元を低く維持でき、大規模産業応用へのスケーラビリティを確保する。
  • MAPOLOは収束効率およびスケーラビリティの両面で、SOTAのマルチエージェント強化学習ベースラインを上回り、実世界への実装可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。