Skip to main content
QUICK REVIEW

[論文レビュー] Towards Symbolic Reinforcement Learning with Common Sense

Artur d’Avila Garcez, Aimore Resende Riquetti Dutra|arXiv (Cornell University)|Apr 23, 2018
Reinforcement Learning in Robotics参考文献 18被引用数 15
ひとこと要約

本稿では、共通知識を組み込む2つの主要な変更(関連する物体との相互作用がある状態でのみQ値を更新すること、およびQ値を物体までの距離に応じて重み付けすること)により、一般化性と特化性を向上させる、深層記号的強化学習の新規拡張である共通知識を備えた記号的強化学習(SRL+CS)を提案する。SRL+CSは、ゼロショット転移学習においてほぼ完璧な性能を達成し、最も難しいテストシナリオで100%の正確性を達成した(DQN(50%)およびDSRL(70%)を上回る)。これは、標準的な強化学習手法に比べて解釈可能性と性能の面で顕著な飛躍を示している。

ABSTRACT

Deep Reinforcement Learning (deep RL) has made several breakthroughs in recent years in applications ranging from complex control tasks in unmanned vehicles to game playing. Despite their success, deep RL still lacks several important capacities of human intelligence, such as transfer learning, abstraction and interpretability. Deep Symbolic Reinforcement Learning (DSRL) seeks to incorporate such capacities to deep Q-networks (DQN) by learning a relevant symbolic representation prior to using Q-learning. In this paper, we propose a novel extension of DSRL, which we call Symbolic Reinforcement Learning with Common Sense (SRL+CS), offering a better balance between generalization and specialization, inspired by principles of common sense when assigning rewards and aggregating Q-values. Experiments reported in this paper show that SRL+CS learns consistently faster than Q-learning and DSRL, achieving also a higher accuracy. In the hardest case, where agents were trained in a deterministic environment and tested in a random environment, SRL+CS achieves nearly 100% average accuracy compared to DSRL's 70% and DQN's 50% accuracy. To the best of our knowledge, this is the first case of near perfect zero-shot transfer learning using Reinforcement Learning.

研究の動機と目的

  • 深層強化学習(DRL)の限界(遅い学習、一般化性の低さ、解釈不能性)を、Q学習と記号的推論を統合することによって克服すること。
  • 学習および意思決定プロセスに共通知識の原則を取り入れることで、強化学習における転移学習性能を向上させること。
  • 明示的な知識工学的作業を必要としない、モデルフリーの記号的強化学習フレームワークを構築すること。
  • 記号的抽象化と共通知識推論を組み合わせることで、確率的および決定的環境において、ほぼ完璧なゼロショット転移学習を達成できるかどうかを評価すること。

提案手法

  • 本手法は、物体認識を単純化し、エージェントに直接的に記号的状態表現を提供することで、深層記号的強化学習(DSRL)を拡張する。
  • 標準的なQ学習に2つの核心的変更を導入する:(1) Q値の更新を、関連する物体と相互作用している状態に限定する(関連性の原則)、(2) 動作選択時に、Q値を物体までの相対的距離の逆数に比例する要因で重み付ける(距離の原則)。
  • Q値更新ルール(式3)は、エージェントが関心のある物体と相互作用している場合にのみQ値を更新し、ノイズを低減し、顕著な状態-行動ペアに学習を集中させる。
  • 動作選択ルール(式4)は、エージェントが物体に近いほどQ値を正規化因子で重み付けし、近い関連物体に対して優先順位を付ける。
  • フレームワークはモデルフリー設定で動作し、明示的な計画や世界モデルに依存せず、記号的状態表現とQ学習にのみ依存する。
  • 本手法は、エージェントが正の物体を収集し、負の物体を回避する必要がある、さまざまな環境条件下でのベンチマークナビゲーションゲームで評価された。

実験結果

リサーチクエスチョン

  • RQ1Q学習に共通知識の原則を取り入れることで、強化学習における一般化性とゼロショット転移性能が向上するか?
  • RQ2Q値の更新を関連する物体相互作用に限定することで、標準的なQ学習に比べて、より速く効果的な学習が達成されるか?
  • RQ3Q値を物体までの距離に応じて重み付けることで、複雑な計画や世界モデルを必要とせずに、記号的強化学習の意思決定が向上するか?
  • RQ4決定的および確率的環境において、SRL+CSはDQN、DSRL、および標準的なQ学習に比べて、正確性と学習速度の点で優れているか?
  • RQ5負の転移が生じる場合、SRL+CSは記号的Q学習に依存しているため、他の手法よりも深刻に失敗するのか?その理由は何か?

主な発見

  • SRL+CSは、最も難しいテストケース(決定的環境で学習し、確率的環境でテスト)において平均100%の正確性を達成し、ほぼ完璧なゼロショット転移学習を実現した。
  • 同じテストシナリオにおいて、DSRLは70%の正確性、DQNは50%にとどまり、SRL+CSの優れた一般化能力が顕著に示された。
  • SRL+CSは、すべての評価済み環境およびタスクのバリエーションにおいて、SRL、Q学習、DQN、DSRLに比べてより速く、より効果的に学習した。
  • 共通知識の原則(関連性に基づく更新と距離重み付け)の両方の組み合わせが、最高のパフォーマンスを発揮するために不可欠であり、片方だけでは部分的な改善にとどまる。
  • 実験6では、対立する物体の位置により負の転移が生じたが、SRL+CSとSRLの両方が、最初に負の物体を収集して失敗した。これは、Q学習の状態-行動一般化能力の限界を示している。
  • この失敗ケースにもかかわらず、SRL+CSは1つの実験を除き、すべての実験で他のすべての手法を上回り、多様な強化学習設定における耐性と有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。