[論文レビュー] Learning What Matters Now: Dynamic Preference Inference under Contextual Shifts
DPIは変化する目的重みについて確率的な信念を維持し、それをポリシーの条件付けに用いることで、マルチオブジェクティブRLにおける文脈の変化にオンラインで適応できる。動的キューイングと迷路タスクにおいて固定ベースラインやヒューリスティックベースラインを上回る。
Humans often juggle multiple, sometimes conflicting objectives and shift their priorities as circumstances change, rather than following a fixed objective function. In contrast, most computational decision-making and multi-objective RL methods assume static preference weights or a known scalar reward. In this work, we study sequential decision-making problem when these preference weights are unobserved latent variables that drift with context. Specifically, we propose Dynamic Preference Inference (DPI), a cognitively inspired framework in which an agent maintains a probabilistic belief over preference weights, updates this belief from recent interaction, and conditions its policy on inferred preferences. We instantiate DPI as a variational preference inference module trained jointly with a preference-conditioned actor-critic, using vector-valued returns as evidence about latent trade-offs. In queueing, maze, and multi-objective continuous-control environments with event-driven changes in objectives, DPI adapts its inferred preferences to new regimes and achieves higher post-shift performance than fixed-weight and heuristic envelope baselines.
研究の動機と目的
- 人間が変化する状況下で嗜好をどのように適応させるかを動機づけ、これを動的な価値重み付けの計算的フレームワークへ翻訳する。
- 動的で未観測の嗜好重みを、文脈とともに漂う潜在状態として形式化する。
- 経験履歴から現在の嗜好を推定する変分推論モジュールを開発し、それに基づく嗜好条件付きポリシーで行動する。
- キューイングや迷路タスクのような非定常環境での適応性と解釈可能性の向上を示す。
提案手法
- 2つのモジュールからなるエージェントを導入する:Value Appraisalモジュールは最近の履歴から潜在嗜好の分布を推定する。
- 嗜好をz_tとして潜在変数として表現し、omega_t = softmax(z_t) を用いて嗜好空間の不確実性と探索をモデル化する。
- K個のサンプル嗜好の中から選択するポリシー付きオンポリシーエンベロープ演算子を備えた嗜好条件付き actor–critic を訓練する。
- 証拠のボルツマン合理性似然と安定性の正則化項(KL事前、方向性整列、自己整合性)を用いたELBOで最適化する。
- ベクトル値リターンとベクトルGAEを用いて各次元のクレジット割当を計算し、ポリシー更新のためにスカラーPPO目的へ射影する。
実験結果
リサーチクエスチョン
- RQ1オンラインでの動的かつ潜在的嗜好重みの推定は、非定常なマルチ目的タスクで性能を改善するか?
- RQ2嗜好を推定・適応するエージェントは、文脈シフト下で固定重みや手動調整のベースラインを上回るか?
- RQ3推定された嗜好は解釈可能で、タスクに関連する目的と整合しているか?
- RQ4提案されたDPIフレームワークは安定性を保ち、異なる環境で解釈可能な適応信号を提供するか?
主な発見
- DPIはQueueおよびMazeタスクにおいて平均エピソード報酬(MER)を最も高く、シフト後の回復を他のベースラインより速く促進する。
- シフト後のパフォーマンスはDPIがイベント後に急速に適応し、短期的な回復で全ベースラインを上回る。
- DPIは成功率の顕著な改善をもたらし、ダイナミックな文脈下でのタスク完遂の頑健性を示す。
- Mazeではナイーブなベースラインが適応できず、DPIは推定嗜好と瞬間報酬構造との間の正の整合性を維持する。
- アブレーションではKL正則化、方向性整列、自己整合性の削除が性能を劣化させることが示され、各成分の重要性を強調する。
- 解釈性分析では、イベント後(例:締切、危険、エネルギー不足)にDPIの推定嗜好がタスク要求と意味的に整合することが示される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。