[論文レビュー] Assistive Tele-op: Leveraging Transformers to Collect Robotic Task Demonstrations
本論文では、VRベースのシステムであるAssistive Tele-opを紹介する。このシステムは、微調整されたトランスフォーマーモデルを用いてリアルタイムでロボットの軌道を予測し、人間のオペレーターが5倍少ない手動制御時間で高成功率のロボットタスクのデモを収集できるようにする。モデルの予測行動が不適切である場合にのみ介入を許容することで、7つの多様な操作タスクにおいて96.1%の成功率を達成した。
Sharing autonomy between robots and human operators could facilitate data collection of robotic task demonstrations to continuously improve learned models. Yet, the means to communicate intent and reason about the future are disparate between humans and robots. We present Assistive Tele-op, a virtual reality (VR) system for collecting robot task demonstrations that displays an autonomous trajectory forecast to communicate the robot's intent. As the robot moves, the user can switch between autonomous and manual control when desired. This allows users to collect task demonstrations with both a high success rate and with greater ease than manual teleoperation systems. Our system is powered by transformers, which can provide a window of potential states and actions far into the future -- with almost no added computation time. A key insight is that human intent can be injected at any location within the transformer sequence if the user decides that the model-predicted actions are inappropriate. At every time step, the user can (1) do nothing and allow autonomous operation to continue while observing the robot's future plan sequence, or (2) take over and momentarily prescribe a different set of actions to nudge the model back on track. We host the videos and other supplementary material at https://sites.google.com/view/assistive-teleop.
研究の動機と目的
- スケールアップした高品質なロボットタスクデモを収集するために必要な作業と時間を削減すること。
- 遠隔操作中の人間の意図とロボットの行動の間の誤解を解消すること。
- 事前学習済みトランスフォーマーを用いて、多様な操作タスクにわたる効率的な少数-shot一般化を可能にすること。
- VRインターフェースにおけるライブ軌道予測と人間の監視を統合することで、データ収集の効率を向上させること。
- 人間の介入によるモデル予測の是正を可能にすることで、継続的学習を促進すること。
提案手法
- 過去の状態と行動の系列を処理するために自己注意機構を備えたトランスフォーマーモデルを活用し、長時間スパンの軌道予測を可能にする。
- エンドエフェクタースペース表現を状態と行動の埋め込みに使用することで、異なるロボットやシミュレータ間での転送を可能にする。
- エンドエフェクタが移動した累積ユークリッド距離に基づいた位置埋め込みを用いて、時間的位置を符号化する。
- 入力系列にBERT風のゼロパディングを適用することで、追加計算を伴わず任意長の将来行動予測を生成する。
- シーン内のオブジェクトポーズ状態に対する補助損失を適用し、予測の正確性と頑健性を向上させる。
- ユーザーがロボットの予測された将来の行動を観察でき、必要に応じてのみ介入できるVR遠隔操作インターフェースにモデルを統合する。
実験結果
リサーチクエスチョン
- RQ1事前学習済みトランスフォーマーは、新しいロボット操作タスクへの少数-shot一般化に効果的に微調整可能か?
- RQ2トランスフォーマーによるリアルタイム軌道予測は、人間-ロボットデモ収集の効率と成功率を向上させるか?
- RQ3VRにおけるライブモデル予測は、手動遠隔操作時間の短縮を図りながらも高いタスク成功率を維持できるか?
- RQ4モデル予測軌道の是正に人間の介入がどれほど効果的か?
- RQ5オブジェクトポーズ状態に対する補助的監視は、正確なタスクにおけるポリシー一般化と成功確率をどの程度向上させるか?
主な発見
- 支援的遠隔操作システムは、完全に手動で制御する場合と比較して、1デモあたりの手動制御時間を5倍短縮した。平均して1タスクあたり5.5秒の干渉時間であった。
- 人間の介入を組み込むことで、7つの多様な操作タスクにおいて96.1%の成功率を達成した。完全自律モードでは67.1%であった。
- 事前学習済みで微調整されたトランスフォーマーは、すべてのタスクで初期学習から訓練したモデルを上回り、強力な少数-shot一般化能力を示した。
- オブジェクトポーズ状態に対する補助損失を適用することで、プレートナット組立タスクの成功率が、事前学習モデルを用いた場合に58%から70%に向上した。
- モデルは効果的なsim2sim移行を示し、MuJoCoのBaxterからOmniverseのFrankaへとロボットの運動学的特性やシミュレーション物理の違いがあるにもかかわらず、良好に一般化した。
- 高精度タスク、たとえば六角形をスロットに挿入するタスクでは10%の成功率にとどまり、主に grasping 失敗と、限られたデモによる分布外一般化の問題に起因していた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。