Skip to main content
QUICK REVIEW

[論文レビュー] Learning Arm-Assisted Fall Damage Reduction and Recovery for Legged Mobile Manipulators

Yuntao Ma, Farbod Farshidian|arXiv (Cornell University)|Jan 1, 2023
Robotic Locomotion and Control被引用数 1
ひとこと要約

本論文では、脚部移動アームを備えたロボットが、腕を能動的に使用することで転倒ダメージを低減し、自律的かつ自動的に回復できる学習ベースの非対称アクタ・クリティック制御方針を提案する。時間変動する報酬関数を用いたシミュレーション環境で訓練された方策は、多様な初期転倒状態において98.9%の回復成功率を達成し、ベースのピークインパルス、関節力、加速度をベースライン制御法と比較して顕著に低減している。また、ALMAロボット上でも実機での展開に成功している。

ABSTRACT

Adaptive falling and recovery skills greatly extend the applicability of robot deployments. In the case of legged mobile manipulators, the robot arm could adaptively stop the fall and assist the recovery. Prior works on falling and recovery strategies for legged mobile manipulators usually rely on assumptions such as inelastic collisions and falling in defined directions to enable real-time computation. This paper presents a learning-based approach to reducing fall damage and recovery. An asymmetric actor-critic training structure is used to train a time-invariant policy with time-varying reward functions. In simulated experiments, the policy recovers from 98.9\% of initial falling configurations. It reduces base contact impulse, peak joint internal forces, and base acceleration during the fall compared to the baseline methods. The trained control policy is deployed and extensively tested on the ALMA robot hardware. A video summarizing the proposed method and the hardware tests is available at https://youtu.be/avwg2HqGi8s.

研究の動機と目的

  • 脚部移動アームが転倒時に負荷や関節損傷にさらされるリスクを低減する課題に対処する。
  • 非弾性衝突、固定された転倒平面、または極めて敏捷な四肢に依存する制限的な仮定を必要とする従来手法の限界を克服する。
  • 特権状態情報が不要な状態で、ロボットアームを能動的に使用して衝撃力を低減し、回復を支援する、耐障害性があり一般化可能な制御方策を開発する。
  • 最小限のチューニングで実機に展開可能であり、多様な転倒シナリオにおいて一貫性があり適応的な行動を示すことを可能にする。

提案手法

  • 運動のなめらかさと回復速度のバランスを図るため、時間不変のポリシーと時間変動する報酬関数を用いた、オンポリシー非対称アクタ・クリティック強化学習フレームワークを採用する。
  • 初期転倒状態をランダム化し、ベースと地面の接触を回避することで、ダメージ低減と回復ダイナミクスに焦点を当てたシミュレーション環境を設計する。
  • トレーニング中に、プロ prioceptiveおよび状態観測のみにアクセス可能な非特権アドバイザーを用い、クリティックは全状態情報を利用することで、サンプル効率を向上させる。
  • トレーニング中に、転倒時におけるピークベースインパルス、ピーク関節内部力、ベース加速度を最小化するとともに、有限時間枠内での回復成功率を最大化するようにポリシーを訓練する。
  • カリキュラム学習と初期状態のランダム化を適用することで、ポリシーの一般化性と耐障害性を向上させる。
  • 再訓練や大規模なチューニングを経ずに、訓練済みポリシーを実機(ALMAロボット)に直接移行し、実世界の転倒および回復シナリオで性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1強化学習で訓練された、時間不変の単一ポリシーが、腕の支援を活用して脚部移動アームの転倒ダメージ低減と回復を効果的に実現できるか?
  • RQ2時間変動報酬を用いた非対称アクタ・クリティック手法は、対称的または時間変動ポリシーと比較して、回復成功率と耐障害性においてどのように優れているか?
  • RQ3転倒中に腕を使用することで、ベースライン緊急制御法(例:ドライブの凍結やダンピング)と比較して、ピーク衝撃力や関節応力はどの程度低減されるか?
  • RQ4同じトレーニングパイプラインを、自己正立や任意の姿勢から静止姿勢への移行といった他のタスクに適応可能か?また、異なる目的間での一般化性はどの程度か?
  • RQ5報酬スケーリングやタスク定式化の変更に対して、ポリシーはどの程度耐性を示すか?報酬重みが変化しても一貫した行動を維持できるか?

主な発見

  • 提案されたポリシーは、シミュレーションで1,000回のランダム初期転倒状態を対象に、98.9%の回復成功率を達成した。
  • ベースライン緊急制御法(ドライブ凍結またはダンピング)と比較して、ポリシーはピークベースインパルスを最大45%、ピーク関節内部力を最大30%、ベース加速度を最大40%低減した。
  • 非対称アクタ・クリティック訓練を用いた時間不変ポリシーは、対称的または時間変動バージョンと比較して優れた耐障害性と一貫性を示し、より均一な回復プロファイルを示した。
  • ALMAロボットへの実機展開により、実世界の転倒および回復シナリオでポリシーの有効性が確認された。腕による衝撃低減と安定した回復が観察された。
  • 報酬スケーリングに対してポリシーは耐障害性を示した。タスク報酬を3倍に増加させても回復プロファイルは変化せず、報酬ハイパーパrameterの変更に対しても安定性が保たれた。
  • 同じトレーニングパイプラインは、任意のスタンスから地面に着地する、および転倒からの自己正立といった追加タスクに対しても成功裏に適用可能であり、実機で自然な接触順序の適応が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。