Skip to main content
QUICK REVIEW

[論文レビュー] DRL: Deep Reinforcement Learning for Intelligent Robot Control -- Concept, Literature, and Future

Aras R. Dargazany|arXiv (Cornell University)|Apr 20, 2021
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本論文は、視覚ベースの観測、記録済みのエキスパートデモ(報酬と行動を含む)、および畳み込みニューラルネットワークを用いた深層Qネットワーク(DQN)を用いて、エンド・トゥ・エンドで最適な制御方策を学習する、汎用的でアプリケーションおよびプラットフォームに依存しない深層強化学習(DRL)フレームワークを提案する。主な貢献は、多様なロボットプラットフォームやタスクにおいて自律的で、頑健かつ一般化可能なロボット学習を可能にする高水準で分離された制御アーキテクチャである。

ABSTRACT

Combination of machine learning (for generating machine intelligence), computer vision (for better environment perception), and robotic systems (for controlled environment interaction) motivates this work toward proposing a vision-based learning framework for intelligent robot control as the ultimate goal (vision-based learning robot). This work specifically introduces deep reinforcement learning as the the learning framework, a General-purpose framework for AI (AGI) meaning application-independent and platform-independent. In terms of robot control, this framework is proposing specifically a high-level control architecture independent of the low-level control, meaning these two required level of control can be developed separately from each other. In this aspect, the high-level control creates the required intelligence for the control of the platform using the recorded low-level controlling data from that same platform generated by a trainer. The recorded low-level controlling data is simply indicating the successful and failed experiences or sequences of experiments conducted by a trainer using the same robotic platform. The sequences of the recorded data are composed of observation data (input sensor), generated reward (feedback value) and action data (output controller). For experimental platform and experiments, vision sensors are used for perception of the environment, different kinematic controllers create the required motion commands based on the platform application, deep learning approaches generate the required intelligence, and finally reinforcement learning techniques incrementally improve the generated intelligence until the mission is accomplished by the robot.

研究の動機と目的

  • 特定のプラットフォーム、アプリケーション、低レベルコントローラーに依存しない、汎用的で高水準の制御アーキテクチャを、知能ロボット制御に導入すること。
  • 高水準知能学習と低レベル運動制御を分離することで、ロボット制御研究を統合し、独立した開発を可能にするフレームワークを提案すること。
  • 深層強化学習と模倣学習に基づく汎用的AIフレームワークの標準化を通じて、ロボット分野における進展を促進すること。
  • 手動でコーディングされたルールの必要性を最小限に抑えるために、RGB-Dカメラ入力と記録済みエキスパートトラジェクトリのみを用いて、視覚から行動へのエンド・トゥ・エンド学習を可能にすること。
  • 自己報酬生成、自己教師学習、模倣学習による少数の例からの適応を通じて、将来のAGIレベルのロボット自律性の基盤を築くこと。

提案手法

  • 同じロボットプラットフォームで人間トレーナーが操作した際の低レベル制御データ(観測、行動、報酬)を、エキスパートデモとして記録する。
  • 畳み込みニューラルネットワーク(CNN)を用いた深層Qネットワーク(DQN)を採用し、原始的なRGB-D画像を入力とし、行動出力を得る。
  • DQNエージェントは、デモデータセット内の成功例と失敗例の両方から学習することで、累積報酬を最大化する行動選択を学習する。
  • 高水準制御方策は、低レベルの運動学的コントローラーとは独立して学習されるため、異なるロボットシステム間でのモジュラー開発と再利用が可能になる。
  • 時間的系列モデリングのためのLSTMなどの再帰的ネットワークへの拡張も可能であり、視覚入力からトルク命令へのエンド・トゥ・エンド学習をサポートする。
  • このフレームワークはアプリケーションおよびプラットフォームに依存しないように設計されており、テーブル・テニスなどのタスクに適したKUKA KR6 R 900 Sixx Agilusを含む多様なロボットに展開可能である。

実験結果

リサーチクエスチョン

  • RQ1視覚とエキスパートデモデータのみを用いて、アプリケーションおよびプラットフォームに依存しない汎用的で高水準の深層強化学習フレームワークを設計できるか?
  • RQ2高水準意思決定知能を低レベル運動制御から分離することで、モジュラーで再利用可能かつスケーラブルなロボット学習システムを実現できるか?
  • RQ3DQNとCNNを用いた深層強化学習は、最小限の人的介入で、複雑な操作タスクにおいて頑健でエンド・トゥ・エンドの視覚から行動への方策学習をどの程度可能にするか?
  • RQ4マルチモーダルセンサーフュージョン(例:RGB-D、LIDAR、高精細カメラ)は、動的環境における頑健でリアルタイムのロボット制御を実現するために果たす役割は何か?
  • RQ5成功と失敗の経験リプレイを通じて、自己報酬生成と自己教師学習を達成でき、自律的で人的知能水準のロボット知能を実現できるか?

主な発見

  • 提案されたDRLフレームワークは、特定のロボットプラットフォーム、アプリケーション、低レベルコントローラーに依存しない高水準のロボット制御を可能にし、再利用性とモularityを促進する。
  • RGB-D画像を入力とし、DQNにCNNを組み合わせたエンド・トゥ・エンド学習により、ロボットは視覚とエキスパートデモデータからのみ複雑な操作タスクを学習可能である。
  • 成功と失敗の両方の経験からの学習をサポートするため、報酬形状の明示的設計がなくても、強化学習による段階的改善が可能である。
  • 記録済みエキスパートデモ(観測、行動、報酬を含む)の使用により、効果的な模倣学習と行動クラーニングが可能となり、環境との広範な相互作用の必要性が低減される。
  • KUKA KR6 R 900 Sixx Agilusのような複雑なロボットシステムにもスケーラブルであり、高速カメラ、LIDAR、ボール投げ機構を備えており、テーブル・テニス学習に適している。
  • 本研究は、自己報酬生成、自己教師学習、およびデモからの少数の例からの学習を組み合わせることで、真のAGIをロボティクス分野で達成するための最も現実的な道筋としてDRLを特定している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。