Skip to main content
QUICK REVIEW

[論文レビュー] Robotic Arm Control and Task Training through Deep Reinforcement Learning

A Franceschetti, Elisa Tosello|arXiv (Cornell University)|May 6, 2020
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

本論文は、シミュレーションおよび現実世界のタスク(到達およびピックアンドプレースを含む)におけるロボットアーム制御のための深層強化学習アルゴリズム—特にTRPOとDQN-NAF—の比較評価を提案する。TRPOが優れた安定性とパフォーマンスを示し、最小限のファインチューニングでシミュレーションから実ハードウェアへのポリシー移行に成功することを示している。

ABSTRACT

This paper proposes a detailed and extensive comparison of the Trust Region Policy Optimization and DeepQ-Network with Normalized Advantage Functions with respect to other state of the art algorithms, namely Deep Deterministic Policy Gradient and Vanilla Policy Gradient. Comparisons demonstrate that the former have better performances then the latter when asking robotic arms to accomplish manipulation tasks such as reaching a random target pose and pick &placing an object. Both simulated and real-world experiments are provided. Simulation lets us show the procedures that we adopted to precisely estimate the algorithms hyper-parameters and to correctly design good policies. Real-world experiments let show that our polices, if correctly trained on simulation, can be transferred and executed in a real environment with almost no changes.

研究の動機と目的

  • 10自由度のロボットアームを用いた操作タスクにおけるTRPO、DQN-NAF、DDPG、VPGの性能を評価および比較すること。
  • シミュレーションで学習したポリシーを実世界のロボットハードウェアに移行させる可能性と耐性を調査すること。
  • 高次元のロボットシステムにおける連続的制御のための効果的なハイパーパramータチューニング手順とネットワークアーキテクチャを同定すること。
  • 示範やタスク固有のドメイン知識なしに、タスクをゼロから学習することを実証すること。
  • リンク長や質量などのロボットダイナミクスや幾何学的変更に対するアルゴリズムの耐性を評価すること。

提案手法

  • TRPO、DQN-NAF、DDPG、VPGを用いて学習するため、物理エンジンを搭載したシミュレーテッド10自由度の協調的ロボットアームを採用した。
  • 制御問題をモデル化するため、状態空間、行動空間、スパarsなバイナリ報酬を備えたマーカフ連鎖意思決定過程(MDP)フレームワークを用いた。
  • 信頼領域ポリシー最適化(TRPO)を適用し、KLダイバージェンス制約を用いてポリシー更新のバウンデッド性を維持する方策勾配更新を実装した。
  • 連続的行動空間におけるQ値推定の安定化を図るため、DQN-NAFを実装し、決定的ポリシー勾配を用いた。
  • シミュレーテッド環境と実ロボットセットアップ間のリアルタイム通信を実現するため、TCPソケットとROSBridgeを統合した。
  • 実世界での正確な状態観測を可能にするために、Microsoft Kinect Oneを用いたAprilTagsを用いたリアルタイムオブジェクトポーズ推定を統合した。

実験結果

リサーチクエスチョン

  • RQ1TRPOとDQN-NAFは、ロボット操作タスクにおける学習安定性、収束速度、最終的パフォーマンスの観点でDDPGやVPGに比べてどのように異なるか?
  • RQ2シミュレーションで学習したポリシーを、最小限の再チューニングで実世界のロボットハードウェアに成功裏に移行できるか?
  • RQ3連続的制御タスクにおける異なるDRLアルゴリズムの最適パフォーマンスを得るために、どのようなハイパーパramータチューニング手順が有効か?
  • RQ4報酬スケーリングへの感受性やパrametrization不変性といったアルゴリズム的特性が、ダイナミクスモデルの変更下でのポリシー耐性にどのように影響するか?
  • RQ5ネットワークアーキテクチャ(深さ/幅)は学習パフォーマンスにどのような役割を果たし、有効なポリシー学習に最低限必要なサイズ要件はあるか?

主な発見

  • TRPOは4980エピソード後、ピックアンドプレースタスクで平均報酬324.97 ± 43.35を達成し、DDPG(257.02 ± 12.59)やVPG(187.11 ± 70.63)を顕著に上回った。
  • TRPOは低分散(324 ± 43)で安定した学習を示したが、VPGとDDPGは高い報酬分散と頻発する grasping 故障(物体の滑りや高すぎる接近速度に起因)を示した。
  • DQN-NAFはピックアンドプレースタスクで平均報酬173.08 ± 9.38を達成し、到達タスクでは優れたパフォーマンスを示したが、把握の安定性は最適でなかった。
  • 実世界のピックアンドプレースタスクはTRPOポリシーを用いて100%の成功率で完了し、シミュレーションから実世界への効果的な移行を確認した。
  • ランダムターゲット到達タスクも100%の成功率で完了し、ロボットはリアルタイムで移動するターゲットを正常に追跡した。
  • TRPOのポリシーはシリンダーをグリッパーに向け傾けるよう学習し、把持の負荷と滑りのリスクを低減した。これが優れたパフォーマンスの要因となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。