[論文レビュー] Interpretable Reinforcement Learning Inspired by Piaget's Theory of Cognitive Development
本稿では、ピアジェの認知発達理論を模倣した神経記号的強化学習フレームワークを提案する。自己抽象化されるスキーマツリーを用いることで、深層ニューラルネットワークに依存せずに解釈可能で人間が理解可能な意思決定を実現する。本手法は、古典的制御環境(例:Pendulum:平均報酬 -112)において競争力のある性能を達成するとともに、言語的思考にインspiredされたアーキテクチャにより生産性、体系的整合性、推論の一貫性を実現する。
Endeavors for designing robots with human-level cognitive abilities have led to different categories of learning machines. According to Skinner's theory, reinforcement learning (RL) plays a key role in human intuition and cognition. Majority of the state-of-the-art methods including deep RL algorithms are strongly influenced by the connectionist viewpoint. Such algorithms can significantly benefit from theories of mind and learning in other disciplines. This paper entertains the idea that theories such as language of thought hypothesis (LOTH), script theory, and Piaget's cognitive development theory provide complementary approaches, which will enrich the RL field. Following this line of thinking, a general computational building block is proposed for Piaget's schema theory that supports the notions of productivity, systematicity, and inferential coherence as described by Fodor in contrast with the connectionism theory. Abstraction in the proposed method is completely upon the system itself and is not externally constrained by any predefined architecture. The whole process matches the Neisser's perceptual cycle model. Performed experiments on three typical control problems followed by behavioral analysis confirm the interpretability of the proposed method and its competitiveness compared to the state-of-the-art algorithms. Hence, the proposed framework can be viewed as a step towards achieving human-like cognition in artificial intelligent systems.
研究の動機と目的
- 深層強化学習と認知科学の間のギャップを埋めるために、強化学習アーキテクチャにピアジェの認知発達理論を統合すること。
- 深層強化学習のブラックボックス性に対処するため、生産性、体系的整合性、推論の一貫性——人間認知の核となる特性——をサポートするシステムを導入すること。
- 解釈可能で事前に定義されたニューラルネットワーク構造に依存しない、自己抽象化され階層的なスキーマベースのアーキテクチャを開発すること。
- 解釈可能でニューラルネットワークに依存しない強化学習エージェントが、標準的な制御ベンチマークで競争力のある性能を達成できることを実証すること。
提案手法
- フレームワークは、ピアジェのスキーマ理論を用いて認知発達をモデル化し、スキーマを自己抽象化可能なツリー構造のノードとして表現し、同化と同調のプロセスを通じて進化させる。
- 各スキーマは、コアな意味を有する一貫性のある繰り返し可能な行動シーケンスであり、抽象化の深さはシステムが動的に決定するもので、事前のアーキテクチャ定義とは無関係である。
- 重み付きセンサ入力(W)に基づく類似度測定により状態マッチングを実現する。重みは報酬に従って更新されるルールに従う:$ W^{new} = W^{old} \pm \beta(U - V) $、ここで $ \beta = 0.04 $。
- 90%の活用と10%の探索を有する$ \epsilon $-greedy方策により、学習の安定性を保ちつつ探索を確保する。
- システムはネイサーの知覚サイクルモデルを実装し、ボトムアップな知覚とトップダウンなスキーマ駆動型行動選択を連続ループで統合する。
- 階層的抽象化をサポートするアーキテクチャであり、異なるオプション(スキーマ)は異なる深さと重みを持つことができ、柔軟で解釈可能な推論を可能にする。
実験結果
リサーチクエスチョン
- RQ1ピアジェのスキーマ理論に基づく強化学習エージェントは、深層ニューラルネットワークを一切使用せずに、標準的な制御タスクで競争力のある性能を達成できるか?
- RQ2生産性、体系的整合性、推論の一貫性——といったコアな認知的特性——を、強化学習フレームワークに形式的に表現できるか?
- RQ3自己抽象化スキーマシステムは、学習効率と一般化性能を維持しつつ、どの程度まで解釈可能性を実現できるか?
- RQ4ネイサーの知覚サイクルモデルによるトップダウンとボトムアップの学習統合は、エージェントの自律性を向上させ、ハイパーパrameterチューニングにおける人間の介入を削減できるか?
主な発見
- Pendulum環境において、階層的スキーマベースのエージェントは最高報酬-112、100回実験の平均報酬-251を達成し、ベースライン手法を上回った。
- 重み初期化に対して高いロバストネスを示した:異なるセンサ入力重みベクトル(例:$ W_1 = [2.2\ 2.4\ 0.7] $、$ W_2 = [1.2\ 1.7\ 1.8] $)でも平均性能は-168で同一であり、安定的かつ解釈可能な行動を示した。
- 報酬フィードバックに従う適応的重み学習($ W^{new} = W^{old} \pm \beta(U - V) $)により、平均報酬が-241、最高報酬が-164に改善され、解釈可能な強化学習における注目メカニズムの価値が示された。
- CartPoleおよびAcrobotでも競争力のある結果を達成し、深層学習に依存せず、環境間での一般化能力を確認した。
- 行動解析により、システムが主な認知的特性を満たしていることが確認された:生産性(無限のスキーマ生成)、体系的整合性(構造的推論)、推論の一貫性(スキーマからの論理的推論)。
- AO2バージョンのすべての意思決定経路が、環境状態に関して人間が解釈可能であり、解釈可能性の核心的主張が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。