Skip to main content
QUICK REVIEW

[論文レビュー] Surface Following using Deep Reinforcement Learning and a GelSightTactile Sensor

Chen Lü, Jing Wang|arXiv (Cornell University)|Dec 2, 2019
Tactile and Sensory Interactions参考文献 22被引用数 8
ひとこと要約

本論文では、GelSightタクトイルセンサを用いたエンドツーエンドの深層強化学習アプローチを提案し、生のタクトイルデータを直接エンドエフェクタの運動方針にマッピングすることで、ロボットによる表面追従を可能にした。SFDQNモデルは、未知または不正確にモデル化された表面でも安定した操作を実現するための接触面積の制御が有効であることを示し、適切な表面追従行動を生成する精度が80%以上に達した。

ABSTRACT

Tactile sensors can provide detailed contact in-formation that can facilitate robots to perform dexterous, in-hand manipulation tasks. One of the primitive but important tasks is surface following that is a key feature for robots while exploring unknown environments or workspace of inaccurate modeling. In this paper, we propose a novel end-to-end learning strategy, by directly mapping the raw tactile data acquired from a GelSight tactile sensor to the motion of the robot end-effector.Experiments on a KUKA youBot platform equipped with theGelSight sensor show that 80% of the actions generated by a fully trained SFDQN model are proper surface following actions; the autonomous surface following test also indicates that the proposed solution works well on a test surface.

研究の動機と目的

  • 生のタクトイルデータを直接ロボットの行動にマッピングする、特徴工学的設計を不要とするロバストでエンドツーエンドの表面追従ポリシーの開発。
  • 特に未知または不正確にモデル化された表面においても、ロボットのエンドエフェクタと物体表面の接触面積を一貫して維持すること。
  • GelSightセンサからのタクトイルフィードバックで訓練された深層Qネットワーク(SFDQN)の性能を、実世界の表面追従タスクにおいて評価すること。
  • 視覚のみでは不十分な複雑で動的な接触状況において、タクトイルベースの制御の実現可能性と適応性を示すこと。

提案手法

  • 本手法は、生のGelSightセンサ画像を入力状態として処理する新規なSFDQNアーキテクチャを備えた深層Qネットワーク(DQN)を採用している。
  • 接触率という指標をGelSight画像から計算し、センサ表面の物体との接触割合を定量化し、状態表現の主要な要因としている。
  • 接触率が所望のターゲット範囲と一致する度合いに応じて、密度・スパarsity・形状を考慮した報酬が与えられる。
  • 行動空間は、エンドエフェクタの運動をリアルタイムで制御するための離散的関節位置調整(例:±0.01 rad)から構成される。
  • 学習中の状態-行動空間カバレッジを向上させるために、ε-greedy探索を用いた行動ポリシーが採用されている。
  • 学習の安定化のため、リプレイバッファとターゲットネットワークを用いてネットワークを訓練し、保持されたテストセットを用いてモデル性能を定期的に評価している。

実験結果

リサーチクエスチョン

  • RQ1GelSightセンサからの生のタクトイルデータを、特徴工学的設計を経ずに、効果的なロボット行動に直接マッピングできるか?
  • RQ2タクトイルフィードバックで訓練された深層Qネットワーク(SFDQN)は、実世界の表面において所望の接触率を維持する上で、どの程度の性能を示すか?
  • RQ3ネットワークの深さ(2層対10層の畳み込み層)が、SFDQNモデルにおける行動予測の安定性と正確性に与える影響は何か?
  • RQ4接触の一時的喪失や急激な表面変化といった実世界の摂動下で、システムはどの程度の性能を示すか?
  • RQ5再トレーニングを行わずに、幾何学的形状や物理的性質が異なる表面に対しても、本手法は一般化可能か?

主な発見

  • SFDQNモデルは、実世界のテスト表面において、『良い』行動(所望の接触率を改善または維持する行動)を生成する精度が80%以上に達した。
  • より深いSFDQNモデル(10層の畳み込み層)は、浅いモデル(2層)に比べて、特に5,000回のトレーニングステップを経過した後、より安定的かつ一貫性のある行動予測を示した。
  • 本システムは、実際の木製表面においても自律的な表面追従を実行でき、一時的なセンサの分離が生じても安定した接触を維持した。
  • 本手法はGelSightセンサの中央領域の接触変化に対して感受性が高かったが、縁部の接触は特に勾配の大きい表面では低く評価されていた。
  • システムには速度の上限が存在し、位置ベースの行動命令とKUKA youBotプラットフォームにおける速度命令の不安定な遅延の制限により、急激な表面変化を効果的に追跡できなかった。
  • GelSightセンサの背景画像が変更された場合には再トレーニングが必要であったため、接触率計算に正確な基準画像への依存性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。