Skip to main content
QUICK REVIEW

[論文レビュー] Learning Sequential Acquisition Policies for Robot-Assisted Feeding

Priya Sundaresan, Jiajun Wu|arXiv (Cornell University)|Sep 11, 2023
Innovations in Concrete and Construction MaterialsEngineering被引用数 3
ひとこと要約

VAPORS は、分類画像からの潜在的プレートダイナミクスを用いてシミュレーションで高レベルの順序的取得方策を学習し、現実世界でビジョンパrameterized低レベルプリミティブによってこれらの計画を実行する階層的フレームワークである。ベースラインと比較して、効率的かつユーザーの好みに優れたプレートクリアランスを達成し、未観測のソース、トッピング、および分布外の料理(例:DoorDashのヌードル)にも一般化でき、平均で64%のクリアランスを達成した。

ABSTRACT

A robot providing mealtime assistance must perform specialized maneuvers with various utensils in order to pick up and feed a range of food items. Beyond these dexterous low-level skills, an assistive robot must also plan these strategies in sequence over a long horizon to clear a plate and complete a meal. Previous methods in robot-assisted feeding introduce highly specialized primitives for food handling without a means to compose them together. Meanwhile, existing approaches to long-horizon manipulation lack the flexibility to embed highly specialized primitives into their frameworks. We propose Visual Action Planning OveR Sequences (VAPORS), a framework for long-horizon food acquisition. VAPORS learns a policy for high-level action selection by leveraging learned latent plate dynamics in simulation. To carry out sequential plans in the real world, VAPORS delegates action execution to visually parameterized primitives. We validate our approach on complex real-world acquisition trials involving noodle acquisition and bimanual scooping of jelly beans. Across 38 plates, VAPORS acquires much more efficiently than baselines, generalizes across realistic plate variations such as toppings and sauces, and qualitatively appeals to user feeding preferences in a survey conducted across 49 individuals. Code, datasets, videos, and supplementary materials can be found on our website: https://sites.google.com/view/vaporsbot.

研究の動機と目的

  • ロボット支援給餡において、長時間にわたる複数ステップにわたる食料取得の課題に対処し、時間経過とともに特殊な操作戦略を組み合わせる必要があること。
  • 画像ベースの潜在的ダイナミクスを用いてシミュレーションで高レベルの計画を学習し、現実世界のビジョンを低レベルプリミティブの実行に依存することで、シミュレーションから現実へのギャップを埋めること。
  • ソース、トッピング、および配達されたヌードルのような分布外の料理を含む多様な食事のバリエーションに一般化すること。
  • 人間らしい給餡戦略(例:取得の前に食べ物をまとめる)を模倣することで、ユーザー体験を向上させること。
  • 専用でビジョンパrameterizedプリミティブを用いた階層的計画が、効率的で直感的なプレートクリアランスを実現できることを示すこと。

提案手法

  • VAPORS は、モデルベース強化学習によりシミュレーションで訓練された高レベル方策を用い、プレートのセグメンテーション画像観測に基づいて、分類された操作戦略(例:スパゲッティをからめる、すくう)のうちの1つを選択する。
  • 高レベル方策は、画像表現からの潜在的プレートダイナミクスをモデル化し、食料取得と再配置の両方を最適化する。
  • 低レベルの行動は、ポーズ推定とセグメンテーションを用いて現実世界のデータで訓練されたビジョンパrameterizedプリミティブ(例:フォークでのからめ、両手でのすくい)を用いて実行される。
  • フレームワークは、高レベルの計画(シミュレーション内)と低レベルの実行(現実世界)を分離しており、スケーラブルな方策学習と現実世界への適応性を可能にしている。
  • シミュレーションと現実世界の環境間での転送性を確保するため、セグメンテーション画像入力を状態表現として用いる。
  • システムは、高レベル方策が次の戦略を選択し、低レベル方策が視覚フィードバックを用いてそれを実行するという階層的な方法で、行動のシーケンスを計画する。
Figure 1: Visual Action Planning OveR Sequences (VAPORS) employs a high level policy $\pi_{H}$ to select amongst discrete manipulation strategies $h$ , such as grouping and twirling, and a low-level vision-parameterized policy $\pi_{L}$ to execute these actions $a_{t}$ for long-horizon dexterous foo
Figure 1: Visual Action Planning OveR Sequences (VAPORS) employs a high level policy $\pi_{H}$ to select amongst discrete manipulation strategies $h$ , such as grouping and twirling, and a low-level vision-parameterized policy $\pi_{L}$ to execute these actions $a_{t}$ for long-horizon dexterous foo

実験結果

リサーチクエスチョン

  • RQ1階層的強化学習フレームワークは、複数の専用操作戦略を組み合わせる長時間にわたる食料取得方策を効果的に学習できるか?
  • RQ2画像ベースの潜在的ダイナミクスを用いたシミュレーション内での高レベル計画は、未観測の食事バリエーションを含む現実世界のプレートクリアランスに一般化できるか?
  • RQ3ビジョンパrameterized低レベルプリミティブの使用は、ヒューリスティックまたは単一プリミティブベースラインと比較して、パフォーマンスとユーザーの好みを向上させるか?
  • RQ4システムは、ソース、トッピング、複雑な食事配置を含む分布外のプレートに対して、どの程度一般化できるか?
  • RQ5ユーザーは、ベースライン手法と比較して、VAPORS の給餡行動を、効率性、自然さ、直感性の観点からどのように評価するか?

主な発見

  • VAPORS は、プレーンヌードル(Tier 1)で90%、ソースヌードル(Tier 2)で68%、DoorDashヌードル(Tier 3)で64%のプレートクリアランスを達成し、強力なゼロショット一般化を示した。
  • ユーザーの好み評価が複数の基準で統計的に有意に高く(p < 0.05)なった。ユーザーは、自然な給餡行動を模倣していると指摘した。
  • ユーザーは、VAPORS がベースラインよりも効率的で直感的であると感じ、特に取得の前に食べ物をまとめる能力に特に満足していた。
  • 失敗要因は主に誤認知(18–25%の失敗)、次にスリップ(Tier 3で23%)が多かった。特にソースや滑らかな食品で顕著だった。
  • VAPORS は、定量的クリアランスと定性的なユーザーフィードバックの両面で、Acquire-Only および Heuristic ベースラインを上回った。
  • フレームワークは、実世界の試行で両手でのすくいやヌードルのからめといった複雑なシーケンスを正常に実行でき、高度な操作能力を実証した。
Figure 2: Action Parameterization: We parameterize acquisition and rearrangement actions relative to the densest $(x_{d},y_{d},z_{d})$ and furthest $(x_{f},y_{f},z_{f})$ regions on the plate, as well as the utensil roll $\gamma$ and pitch $\beta$ .
Figure 2: Action Parameterization: We parameterize acquisition and rearrangement actions relative to the densest $(x_{d},y_{d},z_{d})$ and furthest $(x_{f},y_{f},z_{f})$ regions on the plate, as well as the utensil roll $\gamma$ and pitch $\beta$ .

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。