Skip to main content
QUICK REVIEW

[論文レビュー] Maximizing Information Gain in Partially Observable Environments via Prediction Reward

Yash Satsangi, Sungsu Lim|arXiv (Cornell University)|May 11, 2020
Domain Adaptation and Few-Shot Learning参考文献 46被引用数 4
ひとこと要約

本稿では、部分的に観測可能な環境において、信念に基づく情報量の増加を代替的に用いる予測報酬を用いて、信念状態に依存する情報量の増加を最大化するモデルフリーの強化学習手法であるDeep Anticipatory Networks(DANs)を提案する。理論的に、予測精度の最適化が負エントロピー(情報量の増加)の最大化を近似することを確立し、明示的な信念推定を伴わずに、効率的なディープRLベースの能動的認知を実現する。センサ選択および視覚的注目タスクにおいて、その有効性が実証されている。

ABSTRACT

Information gathering in a partially observable environment can be formulated as a reinforcement learning (RL), problem where the reward depends on the agent's uncertainty. For example, the reward can be the negative entropy of the agent's belief over an unknown (or hidden) variable. Typically, the rewards of an RL agent are defined as a function of the state-action pairs and not as a function of the belief of the agent; this hinders the direct application of deep RL methods for such tasks. This paper tackles the challenge of using belief-based rewards for a deep RL agent, by offering a simple insight that maximizing any convex function of the belief of the agent can be approximated by instead maximizing a prediction reward: a reward based on prediction accuracy. In particular, we derive the exact error between negative entropy and the expected prediction reward. This insight provides theoretical motivation for several fields using prediction rewards---namely visual attention, question answering systems, and intrinsic motivation---and highlights their connection to the usually distinct fields of active perception, active sensing, and sensor placement. Based on this insight we present deep anticipatory networks (DANs), which enables an agent to take actions to reduce its uncertainty without performing explicit belief inference. We present two applications of DANs: building a sensor selection system for tracking people in a shopping mall and learning discrete models of attention on fashion MNIST and MNIST digit classification.

研究の動機と目的

  • 部分的観測環境において、情報量の増加が信念状態に依存するという課題に、ディープ強化学習を適用することを目的とする。
  • 明示的な信念推定が高コストであるのを避けるために、予測報酬を用いた信念に基づく情報量の増加の理論的裏付けのある近似手法を提供することを目的とする。
  • 視覚的注目、質疑応答、内発的動機づけといった、異なる分野を、予測精度を通じた情報量最大化という共通の基盤で統合することを目的とする。
  • リアルタイムで変化する環境(例:センサ選択、画像分類)において、エージェントが不確実性を能動的に低減できるディープラーニングフレームワーク(DANs)を構築することを目的とする。
  • センサ選択および注目タスクにおいて、本手法の実証的妥当性を検証し、ベースライン手法を上回る性能を示すこと

提案手法

  • 任意の信念の凸関数(例:負エントロピー)の最大化が、予測報酬の最大化によって近似可能である理論的枠組みを提示し、正確な誤差バウンドを導出する。
  • 予測報酬を情報量の代替指標として導入し、未知変数の正しく予測された場合に+1、それ以外は0の報酬を与える。
  • 期待予測報酬と負エントロピー(情報量の増加)との正確な関係を導出し、誤差解析および代替報酬の最適化を可能にする。
  • 予測報酬によって探索と不確実性低減を駆動する、ポリシーと予測器を同時に学習するモデルフリーの強化学習アーキテクチャ「Deep Anticipatory Networks(DANs)」を構築する。
  • 未知変数(例:人の位置)が時間とともに変化する継続的学習設定にDANsを適用し、静的分類タスクとは異なった動的環境を想定する。
  • 観測から未知変数を予測するためのディープニューラルネットワークを用い、方策勾配法を用いてポリシーを訓練し、予測精度を最大化する。

実験結果

リサーチクエスチョン

  • RQ1予測報酬は、部分的観測環境における情報量の増加の有効的かつ理論的裏付けのある代替指標として機能できるか?
  • RQ2予測報酬の最大化と情報量の増加(負エントロピー)の最大化との間の正確な誤差は何か?
  • RQ3明示的な信念推定を実行せずに、ディープ強化学習エージェントが不確実性を低減できるか?
  • RQ4提案手法により、視覚的注目、質疑応答、内発的動機づけといった異なる分野が、情報量最大化という共通の原則の下に統合可能か?
  • RQ5DANアーキテクチャは、センサ選択や視覚的注目といった能動的認知タスクで、既存手法を上回る性能を示すか?

主な発見

  • 期待予測報酬は情報量の下界を提供し、凸双対性を用いてそのギャップを解析的に特定している。
  • 適切に予測タスクを設計することで、予測報酬の最大化と情報量の増加の最大化との誤差を最小化でき、効果的な近似が可能になる。
  • DANsはショッピングモールにおける人物追跡のためのセンサ選択タスクで最先端の性能を達成し、信念ベースのベースラインを上回る追跡精度と情報量の増加を実現した。
  • ファッションMNISTおよびMNISTの数字分類タスクにおいて、DANsは固定サイズのグリムスを用いても、情報量の多い画像領域に注目する離散的注目メカニズムを学習し、分類精度を向上させた。
  • 本手法により、明示的な信念状態推定や手作業で設計された世界モデルを必要とせず、連続的かつ動的な環境においてモデルフリーのディープRLによる能動的認知が可能になった。
  • 理論的枠組みはエントロピーに限らず、信念の任意の凸関数に一般化可能であり、より広範な不確実性低減問題への応用が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。