Skip to main content
QUICK REVIEW

[論文レビュー] Variational Policy for Guiding Point Processes

Yichen Wang, Grady Williams|arXiv (Cornell University)|Jan 30, 2017
Point processes and geometric inequalities参考文献 38被引用数 8
ひとこと要約

本論文は、確率的最適制御を測度論的推論問題として定式化することにより、時系列ポイント過程をガイドするための変分ポリシー枠組みを提案する。変分推論とKLダイバージェンスを用いて、スケーラブルで適応可能な制御ポリシーを導出し、強度関数を最適化することで、合成的および実世界のソーシャルネットワーク応用において、ユーザー行動を目的の状態へ誘導する性能を顕著に向上させる。

ABSTRACT

Temporal point processes have been widely applied to model event sequence data generated by online users. In this paper, we consider the problem of how to design the optimal control policy for point processes, such that the stochastic system driven by the point process is steered to a target state. In particular, we exploit the key insight to view the stochastic optimal control problem from the perspective of optimal measure and variational inference. We further propose a convex optimization framework and an efficient algorithm to update the policy adaptively to the current system state. Experiments on synthetic and real-world data show that our algorithm can steer the user activities much more accurately and efficiently than other stochastic control methods.

研究の動機と目的

  • ソーシャルシステムにおけるユーザー行動を時系列ポイント過程としてモデル化する際の、有効な制御ポリシーの欠如に取り組む。
  • 線形近似に依存し、二次コスト関数を用い、解が得にくいHJB偏微分方程式に依存する従来の確率的制御手法の限界を克服する。
  • ハーケス過程などのポイント過程によって駆動される非線形かつ高次元のシステムに対して、一般化可能でスケーラブルかつ適応可能な制御枠組みを構築する。
  • 制御理論で一般的に見られる任意のコスト関数の設計を避けるために、確率的ダイナミクスから自然に生じる構造的制御コスト関数を提供する。
  • 現在のシステム状態に基づいて、前方サンプリングと変分推論を用いて、リアルタイムで適応可能なモデル予測制御を実現する。

提案手法

  • 確率的最適制御問題を測度論的視点から、最適測度選択問題に再定式化する。
  • 制御された測度と元の測度の間のKLダイバージェンスを含む変分目的関数を最小化することで、最適測度の解析的表現を導出する。
  • 制御コスト関数をダイナミクスから自然に生じさせる。制御理論で一般的な任意のコスト関数設計を回避する。
  • 前方サンプリングを用いてポリシーを計算するスケーラブルなモデル予測制御(MPC)アルゴリズムを開発し、リアルタイムでの適応を可能にする。
  • 目標測度とポリシーが誘導する測度の間のKLダイバージェンスを最小化することで、最適ポリシーを近似するための変分推論を用いる。
  • 現在のシステム状態と歴史的観測に基づいて、各時刻でポリシーを効率的に更新するための凸最適化フレームワークを採用する。

実験結果

リサーチクエスチョン

  • RQ1非線形かつ高次元のシステムをポイント過程(例:ハーケス過程)によって駆動する一般化された制御ポリシーをどのように設計できるか?
  • RQ2システムのダイナミクスが自然に組み込まれた制御コスト関数を有する制御ポリシーを導出できるか?
  • RQ3複雑で非同期的なイベントダイナミクスと長期記憶効果を有するシステムにおいて、スケーラブルでリアルタイムの制御を実現できるか?
  • RQ4従来の確率的制御法およびヒューリスティック手法と比較して、変分ポリシー枠組みがユーザー行動の誘導においてどの程度の性能向上を達成できるか?
  • RQ5提案手法は、競合が激しいソーシャルメディア環境において、ブロードキャスターの可視性を効果的に維持できるか?

主な発見

  • KL-MPCはブロードキャスターの平均順位を1.5にまで低下させ、CE-MPCの4倍低い水準に達し、理想のトップ1性能に近い。
  • KL-MPCは予測精度をCE-MPCと比較して30%以上向上させ、最良の評価スキームでは0.3を超える精度を達成した。
  • 本手法は、競合の活動状況に応じて強度を適応的に調整することができた—競合が活発な際には投稿頻度を増加させ、活動が停止している際には減少させた。
  • 実世界の実験において、グリーディ、FD、CEベースのベースラインと比較して、状態コストおよび予測精度の両方の指標で本フレームワークが優れた性能を示した。
  • 適応的な強度調制の結果、システム行動に影響を与える一方で、元の強度からの過度な逸脱を避けるバランスを保っていることが裏付けられた。
  • 前方サンプリングに基づくMPC設計と凸最適化フレームワークのおかげで、本アルゴリズムはスケーラブルであり、リアルタイム導入に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。