Skip to main content
QUICK REVIEW

[論文レビュー] Keypoint Action Tokens Enable In-Context Imitation Learning in Robotics

Norman Di Palo, Edward Johns|arXiv (Cornell University)|Mar 28, 2024
Robot Manipulation and Learning被引用数 4
ひとこと要約

この論文では、GPT-4 Turbo などのオフザシェルのテキスト事前学習済みトランスフォーマーが、視覚的観測とアクション軌跡をキーポイントベースのテキストトークンに変換することで、ロボティクス分野における少データの文脈内模倣学習を可能にする Keypoint Action Tokens (KAT) を導入する。ロボティクスデータに対する微調整なしで、わずか10件のデモンストレーションでの実世界タスクにおいて最先端の性能を達成しており、大規模言語モデルがパターン学習のみで視覚・アクションのシーケンス対シーケンスタスクに一般化できることを示している。

ABSTRACT

We show that off-the-shelf text-based Transformers, with no additional training, can perform few-shot in-context visual imitation learning, mapping visual observations to action sequences that emulate the demonstrator's behaviour. We achieve this by transforming visual observations (inputs) and trajectories of actions (outputs) into sequences of tokens that a text-pretrained Transformer (GPT-4 Turbo) can ingest and generate, via a framework we call Keypoint Action Tokens (KAT). Despite being trained only on language, we show that these Transformers excel at translating tokenised visual keypoint observations into action trajectories, performing on par or better than state-of-the-art imitation learning (diffusion policies) in the low-data regime on a suite of real-world, everyday tasks. Rather than operating in the language domain as is typical, KAT leverages text-based Transformers to operate in the vision and action domains to learn general patterns in demonstration data for highly efficient imitation learning, indicating promising new avenues for repurposing natural language models for embodied tasks. Videos are available at https://www.robot-learning.uk/keypoint-action-tokens.

研究の動機と目的

  • ロボティクスデータへの微調整なしに、事前学習済み言語モデルを用いて少データの模倣学習を可能にすること。
  • 大規模テキストベースのトランスフォーマーの顕在的少データパターン認識能力を活用して、ロボット学習におけるデータ不足の課題に対処すること。
  • 視覚的観測とアクションシーケンスをテキスト互換のトークン形式にマップする汎用フレームワークを構築すること。
  • オフザシェルのLLMが、特殊な模倣学習モデル(例:拡散ポリシー)と同等またはそれ以上の性能を少データ環境で示せるかどうかを評価すること。
  • 空間一般化、未知のオブジェクト一般化、6-DoF軌道制御を含む多様な実世界タスクにおけるKATのスケーラビリティとパフォーマンスを調査すること。

提案手法

  • Keypoint Action Tokens (KAT) は、視覚的観測とアクション軌跡をキーポイント座標のシーケンスとして表現し、それを自然言語トークン(例:'left hand at (x,y,z)')に変換してテキストベースのトランスフォーマーに入力する。
  • この手法は、各観測フレームから固定数のキーポイント(K)を抽出する事前学習済みビジョントランスフォーマーを使用し、空間的・時間的構造を記述的トークンのシーケンスにエンコードする。
  • デモンストレーションと現在の観測がプロンプトに連結され、入力シーケンスにはエキスパートデモンストレーションからのキーポイントトークンとアクショントークンが含まれる。
  • テキスト事前学習済みトランスフォーマー(例:GPT-4 Turbo)は、プロンプトに基づいて次のアクショントークンのシーケンスを生成することで文脈内学習を実行し、その出力をロボット制御命令にデコードする。
  • このフレームワークは完全に推論モードで動作し、ロボティクスデータに対する微調整や追加学習を一切必要としない。
  • この手法は長文の入力をサポートしており、1つのプロンプト内で複数のデモンストレーションや複雑な軌道を処理できる。
Figure 1: An illustration of our pipeline. KAT transforms a visual observation into a sequence of keypoint tokens . From it, the text-pretrained Transformer (LLM) predicts action tokens , that are then executed as a trajectory of poses.
Figure 1: An illustration of our pipeline. KAT transforms a visual observation into a sequence of keypoint tokens . From it, the text-pretrained Transformer (LLM) predicts action tokens , that are then executed as a trajectory of poses.

実験結果

リサーチクエスチョン

  • RQ1オフザシェルのテキスト事前学習済みトランスフォーマーは、ロボティクスデータへの微調整なしに、少データの文脈内模倣学習を実行できるか?
  • RQ2わずか10件のデモンストレーションでのKATの未知のオブジェクト、空間的構成、マルチモーダル行動への一般化性能はどの程度か?
  • RQ3新しい世代のLLMを用いることで、ロボティクス特化のトレーニングなしにKATの性能が向上するか?
  • RQ4KATは、少データ環境において最先端の拡散ポリシーと同等またはそれ以上の性能を発揮できるか?
  • RQ5長時間のデモンストレーションシーケンスやリアルタイムのオンライン制御にスケーリングする際、KATの限界は何か?

主な発見

  • KATは、わずか10件のデモンストレーションと微調整なしで、実世界のロボットタスク(例:Align T, Wipe Plate, Sweep, Bottle Upright)において最先端の性能を達成した。
  • GPT-4 Turbo は、GPT-3 Turbo や GPT-2 よりも少データの模倣学習で優れた性能を示し、最新のLLMが視覚・アクションシーケンスにさらに良い一般化を示すことを示した。
  • KATは、少データ環境で拡散ポリシーと同等またはそれ以上の性能を発揮しており、LLMを用いた文脈内学習が模倣学習において非常に効率的である可能性を示している。
  • LLMのコンテキスト窓が大きくなるほど性能が向上し、より長い入力シーケンスがパターン認識と軌道生成を強化することが示唆された。
  • モデル再トレーニングが不要なため、デモンストレーション後すぐに学習済みスキルをデプロイ可能である。
  • KATは未知のオブジェクトや空間的構成に対しても強力な一般化を示しており、実世界環境における分布シフトに対しても頑健であることが示された。
Figure 2: Illustration of the extraction pipeline of keypoint tokens .
Figure 2: Illustration of the extraction pipeline of keypoint tokens .

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。