Skip to main content
QUICK REVIEW

[論文レビュー] Transformers are Adaptable Task Planners

Vidhi Jain, Yixin Lin|arXiv (Cornell University)|Jul 6, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本論文は、オブジェクト中心的で時系列的かつポーズに敏感な表現を用いて、デモから高レベルな操作ポリシーを学習するトランスフォーマー基盤のタスクプランナー(TTP)を提案する。TTPは1つのデモで未確認のユーザーの好みに一般化でき、シミュレーションから実世界のFranka Pandaロボットへのゼロショット転送を達成し、食器の再配置タスクを実現する。

ABSTRACT

Every home is different, and every person likes things done in their particular way. Therefore, home robots of the future need to both reason about the sequential nature of day-to-day tasks and generalize to user's preferences. To this end, we propose a Transformer Task Planner(TTP) that learns high-level actions from demonstrations by leveraging object attribute-based representations. TTP can be pre-trained on multiple preferences and shows generalization to unseen preferences using a single demonstration as a prompt in a simulated dishwasher loading task. Further, we demonstrate real-world dish rearrangement using TTP with a Franka Panda robotic arm, prompted using a single human demonstration.

研究の動機と目的

  • 動的環境とユーザー固有の好みを考慮したロボティクス分野における柔軟で長時間のタスク計画の学習という課題に取り組む。
  • シンボリックタスクプランニングの限界を克服し、手動でコーディングされた制約の代わりにデモからのエンドツーエンド学習を採用する。
  • 1つの人間のデモをプロンプトとして用いることで、未確認の好みへのゼロショット一般化を可能にする。
  • 食器洗い機への荷物の積み込みや引き出しの整理といった複雑な操作タスクにおけるシミュレーションから実世界へのギャップを埋める。

提案手法

  • 各オブジェクトを3次元ポーズ、カテゴリ、タイムステップを組み合わせた7次元ベクトルとして表現することで、空間的・時系列的モデリングを可能にする。
  • 時間、オブジェクトポーズ、カテゴリに特化した埋め込みを備えたトランスフォーマー・アーキテクチャを用い、アクションシーケンスにおける長距離依存関係をモデル化する。
  • 7つの異なるユーザーの好みを80件のデモずつ用いて事前学習することで、一般化された時系列表現を学習する。
  • プロンプトベースの推論を適用:1つの人間のデモがテスト時の新しい好みを条件づける。
  • 各オブジェクトカテゴリごとに事前にコンパイルされた離散的な配置ポーズを用い、食器洗い機内の可能な位置を密にカバーする。
  • 過去の状態のコンテキストウインドウを活用することで、部分観測(例:閉じたラック)に対処し、不確実性下での意思決定を向上させる。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー基盤のアーキテクチャは、シンボリックタスク記述なしに、長時間のデモからタスク構造と好みを暗黙的に学習できるか?
  • RQ2好みに応じた事前学習により、1つのデモのみを用いて未確認のユーザーの好みへのゼロショット一般化が可能か?
  • RQ3変動するオブジェクト数と部分観測状態を伴う動的環境において、モデルの効果性はどの程度か?
  • RQ4ポーズおよびカテゴリ埋め込みの設計が、実世界への転送性能にどの程度影響を与えるか?
  • RQ51つの実世界のデモのみを用いて、シミュレーションから実世界の操作タスク(例:食器の再配置)への一般化が可能か?

主な発見

  • TTPは、すべてのコンテキストウインドウサイズにおいて、バリデーションで90%を超えるカテゴリレベルの予測精度を達成しており、部分観測に対する頑健性を示している。
  • ポーズ埋め込みのフーリエ変換は、元の7次元ポーズベクトルを上回る性能を示しており、空間的・時系列的ニュアンスのより良い符号化が可能であることを示唆している。
  • 大きなコンテキストウインドウは初期学習を加速するが、最終的な性能に寄与しないことから、データセットは短いコンテキストでほとんど観測可能であると示唆している。
  • TTPは未確認の好みや動的シーンに一般化でき、シミュレーションおよび実世界の評価において、競合するベースラインを上回っている。
  • 1つの人間のデモをプロンプトとして用いることで、ゼロショット転送が実世界のFranka Pandaロボットで成功し、食器を2つの引き出しに整理した。
  • モデルは、オブジェクト数の変動や未学習の構成に対しても強く一般化しており、学習分布を超えた柔軟性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。