[論文レビュー] Autotelic Agents with Intrinsically Motivated Goal-Conditioned Reinforcement Learning: a Short Survey
本論文は、自己目標生成と学習を内発的に動機づける人工知能エージェント(自己目的的エージェント)を実現するフレームワークを提案する。目的に依存する強化学習(RL)を用い、目標をコンパクトな表現と目標達成関数のペアとしてモデル化することで、エージェントが自律的に探索し、目標を組み合わせ、スキルを一般化できるようにする。これにより、人工知能におけるオープンエンド、生涯にわたる学習が前進する。
Building autonomous machines that can explore open-ended environments, discover possible interactions and build repertoires of skills is a general objective of artificial intelligence. Developmental approaches argue that this can only be achieved by $autotelic$ $agents$: intrinsically motivated learning agents that can learn to represent, generate, select and solve their own problems. In recent years, the convergence of developmental approaches with deep reinforcement learning (RL) methods has been leading to the emergence of a new field: $developmental$ $reinforcement$ $learning$. Developmental RL is concerned with the use of deep RL algorithms to tackle a developmental problem -- the $intrinsically$ $motivated$ $acquisition$ $of$ $open$-$ended$ $repertoires$ $of$ $skills$. The self-generation of goals requires the learning of compact goal encodings as well as their associated goal-achievement functions. This raises new challenges compared to standard RL algorithms originally designed to tackle pre-defined sets of goals using external reward signals. The present paper introduces developmental RL and proposes a computational framework based on goal-conditioned RL to tackle the intrinsically motivated skills acquisition problem. It proceeds to present a typology of the various goal representations used in the literature, before reviewing existing methods to learn to represent and prioritize goals in autonomous systems. We finally close the paper by discussing some open challenges in the quest of intrinsically motivated skills acquisition.
研究の動機と目的
- オープンエンドな環境において、人工エージェントが自律的かつ自己決定的に目標を生成・表現・遂行できるようにする課題に対処すること。
- 内部動機づけを目的に依存する強化学習と統合することで、発達的ロボット工学とディープ強化学習を橋渡しすること。
- 自己生成され、多様で合成可能な目標をサポートする計算フレームワークを構築すること。
- 自律的エージェントにおける目標表現、目標の優先順位付け、スキルの一般化に関する主な課題を特定し、それらに対処すること。
- 社会的・文化的環境が、人間や社会にとって意味のある目標表現をどのように形作れるかを検討すること。
提案手法
- 目標を、コンパクトな目標表現と関連する目標達成関数のペアとして定義する一般的な定義を提示する。
- 既存の目標表現を文献から分類し、状態ベース、画像ベース、言語ベース、累積量ベースの目標を含む。
- 目的に依存する強化学習を用いた目標表現の学習手法をレビューし、逆強化学習、目標埋め込みネットワーク、生成モデルを含む。
- 外部報酬が存在しない状況で、目標選択と探索を促進するために、内部動機づけ(例:予測誤差、好奇心)の使用を提唱する。
- 階層的およびオプションベースの強化学習を用い、異なる目標間でのスキルの組み合わせと転送を可能にする。
- エージェントが累積量の線形結合や離散的目標要素を用いて目標を合成できるようにし、未知のタスクへの一般化を可能にする。
実験結果
リサーチクエスチョン
- RQ1外部の監視なしに、人工エージェントがどのように自律的に目標を生成・表現できるか。
- RQ2どのような種類の目標表現が、オープンエンドな環境における効果的な探索と一般化を可能にするか。
- RQ3外部報酬が存在しない状況で、内部動機づけをどのように形式化し、目標選択と学習を導けるか。
- RQ4エージェントは、既存のスキルや目標をどのように組み合わせて、新たな複雑な行動を形成できるか。
- RQ5社会的・文化的環境は、人間の価値観や社会的関連性に適合する目標表現をどのように形成できるか。
主な発見
- 目的に依存する強化学習は、もともとはこの意図で設計されていなくても、内発的動機づけと自己主導的学習のコアなメカニズムとして再解釈可能である。
- 内部動機づけと目的に依存する強化学習の統合により、エージェントは多様で非自明な行動を探索し、オープンエンドなスキルの蓄積が可能になる。
- 言語ベースおよび離散的目標表現は、合成的一般化を可能にし、エージェントが既知の目標を組み合わせて新たな複雑な指示を実行できる。
- オプションフレームワークによる累積量ベースの目標表現により、既知の行動の任意の線形結合に一般化可能となり、柔軟なスキル転送が実現できる。
- 進展は見られるものの、同時に複数のスキルを合成する能力や、長時間スパンの目標達成は、現在のフレームワークにおいてはまだ十分に検討されていない課題である。
- 社会的・文化的環境は、人間が意味すると感じる概念に目標表現を根付かせる上で不可欠であり、社会的整合性を持つAIへの道筋を示唆する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。