[論文レビュー] Where do goals come from? A Generic Approach to Autonomous Goal-System Development
本論文では、内部報酬と自己検出による行動結果の分析から、自律的に高レベルの抽象的概念としての目標を学習できる計算フレームワーク「ラティント・ゴール・アナリシス(LGA)」を提案する。報酬信号を説明する潜在変数としての目標を扱うことで、LGAは強化学習における次元削減を可能にし、視覚的サリエンシーに基づく情報探索報酬から、目的指向的到達行動の出現を示した。外部教師なしで自己教師ありの目標システム開発が実現された。
Goals express agents' intentions and allow them to organize their behavior based on low-dimensional abstractions of high-dimensional world states. How can agents develop such goals autonomously? This paper proposes a detailed conceptual and computational account to this longstanding problem. We argue to consider goals as high-level abstractions of lower-level intention mechanisms such as rewards and values, and point out that goals need to be considered alongside with a detection of the own actions' effects. We propose Latent Goal Analysis as a computational learning formulation thereof, and show constructively that any reward or value function can by explained by goals and such self-detection as latent mechanisms. We first show that learned goals provide a highly effective dimensionality reduction in a practical reinforcement learning problem. Then, we investigate a developmental scenario in which entirely task-unspecific rewards induced by visual saliency lead to self and goal representations that constitute goal-directed reaching.
研究の動機と目的
- 自律的エージェントが外部教師や事前定義されたタスクなしに目標をどのように開発できるかという、長年の未解決問題に取り組むこと。
- 行動結果の自己検出に基づき、報酬および価値システムの低レベルな要因としての目標を高レベルの抽象概念として概念化すること。
- あらゆる報酬関数が潜在的目標と自己検出メカニズムの組み合わせによって説明可能である一般化された計算フレームワークを構築すること。
- LGAの実用的有用性を、強化学習における次元削減およびタスクに依存しない報酬から目的指向的行動をブートストラップする応用において示すこと。
- 視覚的サリエンシーを内部報酬として用いたロボティクス環境において、目標表現および自己認識の発達的出現を調査すること。
提案手法
- 目標を報酬システムの抽象的概念とし、行動結果の自己検出と併せて学習されるべきものとして概念的フレームワークを提示すること。
- センサデータ、行動データ、報酬データから潜在的目標と自己検出状態を同定する計算学習定式化として、ラティント・ゴール・アナリシス(LGA)を導入すること。
- 目標と自己検出を観測された報酬を説明する潜在変数としてモデル化し、確率的推論タスクとして学習問題を定式化すること。
- 変分推論アプローチを用いて、潜在的目標と自己検出の事後分布を近似し、スケーラブルな学習を可能にすること。
- LGAを次元削減手法として推薦システムタスクに適用し、学習された目標を高次元データのコンパクトな表現として用いること。
- 視覚的サリエンシーをタスクに依存しない報酬として用いた発達的ロボティクス実験を実装し、LGAが目的指向的到達行動および自己表現の出現を可能にしたことを示すこと。
実験結果
リサーチクエスチョン
- RQ1エージェントは外部教師や事前定義されたタスクなしに、どのようにして自律的に目標を学習できるか?
- RQ2目標、報酬、行動結果の自己検出との間には、どのような概念的関係があるか?
- RQ3任意の報酬関数は、潜在的目標と自己検出メカニズムの組み合わせによって説明可能か?
- RQ4LGAは強化学習における有効な次元削減手法として機能できるか?
- RQ5視覚的サリエンシーのようなタスクに依存しない内部報酬は、目的指向的行動および自己表現の出現を引き起こせるか?
主な発見
- LGAは報酬信号から潜在的目標を効果的に抽出し、オンラインニュース推薦タスクにおける強化学習の次元削減に成功した。
- 推薦システム実験において、LGAで学習された目標は、標準的なベースライン手法を上回る予測性能を示した。
- 発達的実験では、サリエンシーに基づく情報探索報酬が、短い学習期間内でロボットの手と標的オブジェクト間の接触率を100%まで向上させた。
- ロボットは距離に応じてエフェクタの異なる部位を用いてオブジェクトに接触するよう学習し、非恣意的で適応的な目標表現が得られた。
- 自己検出による手とオブジェクトの接触が、目標表現とともに自然に出現し、自己教師ありモーターラーニングの閉ループシステムを形成した。
- LGAとゴール・バブリングの組み合わせにより、事前定義された目標やタスク特化型報酬なしに、目的指向的到達行動を生成できた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。