[論文レビュー] Learning to Collaborate: Multi-Scenario Ranking via Multi-Agent Reinforcement Learning
本稿では、集中型のコーチ、私的エージェント(決定論的方策を用いる)、およびスコア間の文脈共有のための再帰的メッセージ伝達を組み合わせることで、複数のシナリオ(例:検索、レコメンド、広告)における順序付け戦略の協調的最適化を可能にするマルチエージェント強化学習フレームワーク、MA-RDPGを提案する。大規模な電子商取引プラットフォーム上で評価された結果、独立した最適化ベースラインと比較して、全体的なプラットフォームパフォーマンスが顕著に向上し、長期的な報酬最大化を統合的に実現することで、順序付けの質が向上したことが示された。
Ranking is a fundamental and widely studied problem in scenarios such as search, advertising, and recommendation. However, joint optimization for multi-scenario ranking, which aims to improve the overall performance of several ranking strategies in different scenarios, is rather untouched. Separately optimizing each individual strategy has two limitations. The first one is lack of collaboration between scenarios meaning that each strategy maximizes its own objective but ignores the goals of other strategies, leading to a sub-optimal overall performance. The second limitation is the inability of modeling the correlation between scenarios meaning that independent optimization in one scenario only uses its own user data but ignores the context in other scenarios. In this paper, we formulate multi-scenario ranking as a fully cooperative, partially observable, multi-agent sequential decision problem. We propose a novel model named Multi-Agent Recurrent Deterministic Policy Gradient (MA-RDPG) which has a communication component for passing messages, several private actors (agents) for making actions for ranking, and a centralized critic for evaluating the overall performance of the co-working actors. Each scenario is treated as an agent (actor). Agents collaborate with each other by sharing a global action-value function (the critic) and passing messages that encodes historical information across scenarios. The model is evaluated with online settings on a large E-commerce platform. Results show that the proposed model exhibits significant improvements against baselines in terms of the overall performance.
研究の動機と目的
- 大規模オンラインプラットフォームにおける複数のシナリオにまたがる順序付け戦略の独立的最適化が引き起こす部分最適化の問題を解消すること。
- 現在の独立最適化では無視されている、異なる順序付けシナリオ(例:メイン検索、店内検索)間のユーザー行動の相関関係をモデル化すること。
- 各シナリオをマルチエージェント強化学習フレームワーク内の協調的エージェントとして扱うことで、複数の順序付け目的(例:CTR、CVR、GMV)の共同最適化を可能にすること。
- 連続的アクション空間と長期的信用配分をサポートする、スケーラブルで完全に協調的かつ部分的に観測可能なマルチエージェント強化学習モデルを設計すること。
- エージェントが自らの即時の指標を超えて将来の報酬を考慮できるようにすることで、全体的なプラットフォーム全体のパフォーマンスを向上させること。
提案手法
- 複数シナリオの順序付けを、完全に協調的かつ部分的に観測可能なマルチエージェント逐次意思決定問題として定式化する。
- 全体のパフォーマンスを評価するグローバルな行動価値関数を評価する集中型コーチを備えたMA-RDPGを導入する。
- 各シナリオごとに1つの私的エージェント(エージェント)を採用し、決定論的方策を用いて連続的アクション(例:アイテム順序付け)を生成する。
- エージェント間が履歴的なスコア間文脈をエンコードしたメッセージを伝達できる再帰的通信コンponentを統合する。
- メッセージ履歴を符号化し、スコア間の依存関係の時間的モデリングを可能にするため、再帰的ニューラルネットワーク(LSTM)を用いる。
- 集中学習と分散実行を組み合わせた再帰的決定論的方策勾配(RDPG)アルゴリズムを適用し、学習の安定化と連続的アクション空間のサポートを実現する。
実験結果
リサーチクエスチョン
- RQ1複数の順序付けシナリオにまたがる協調的最適化は、独立的最適化と比較して、より良い全体的なプラットフォームパフォーマンスをもたらすか?
- RQ2ユーザー行動のシナリオ間相関関係を効果的にモデル化することで、共同順序付けパフォーマンスを向上させられるか?
- RQ3エージェント間の通信と共有価値関数学習は、マルチエージェント順序付けパフォーマンスにどのような影響を及ぼすか?
- RQ4メッセージ伝達を伴う集中型コーチは、複数シナリオ順序付けにおいて、より良い信用配分と長期的報酬最大化を可能にするか?
- RQ5提案されたMA-RDPGモデルは、各シナリオを独立に最適化するベースライン手法と比較して、どのように異なるか?
主な発見
- MA-RDPGは、各シナリオを独立に最適化するベースライン手法と比較して、全体的なプラットフォームパフォーマンスで顕著な向上を達成した。
- モデルは、スコア間の協調的連携と長期的報酬の考慮を可能にすることで、複数のシナリオにおけるCTR、CVR、GMVの共同最適化を向上させた。
- 大規模な電子商取引プラットフォームでのオンラインA/Bテストの結果、MA-RDPGはL2R+L2Rベースラインよりも全体的な順序付け効果性が優れていた。
- ケーススタディの結果、MA-RDPGが生成したメイン検索結果は、店内検索の目的とより戦略的に整合しており、高意図ユーザーとブランド品を優遇することで、将来的なコンバージョンを促進していた。
- MA-RDPGの通信メカニズムにより、エージェント間で文脈情報を共有できるようになり、より一貫性がありグローバルに最適な順序付け意思決定が実現した。
- モデルはユーザーがシナリオ間を切り替える行動(例:メイン検索から店内検索に25.46%の割合で移動)を効果的に捉え、その相関関係を活用してスコア間パフォーマンスを向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。