[論文レビュー] Correcting Robot Plans with Natural Language Feedback
本論文では、自然言語フィードバックを用いてロボットの運動計画を補正する手法を提案する。この手法は、言語の修正を、ロボットの計画目的を変更する残留コスト関数にマッピングする学習を行う。このアプローチにより、1回または2回の言語修正で、それぞれ81%および93%の成功率を達成し、予期しない環境やタスクに一般化する。
When humans design cost or goal specifications for robots, they often produce specifications that are ambiguous, underspecified, or beyond planners' ability to solve. In these cases, corrections provide a valuable tool for human-in-the-loop robot control. Corrections might take the form of new goal specifications, new constraints (e.g. to avoid specific objects), or hints for planning algorithms (e.g. to visit specific waypoints). Existing correction methods (e.g. using a joystick or direct manipulation of an end effector) require full teleoperation or real-time interaction. In this paper, we explore natural language as an expressive and flexible tool for robot correction. We describe how to map from natural language sentences to transformations of cost functions. We show that these transformations enable users to correct goals, update robot motions to accommodate additional user preferences, and recover from planning errors. These corrections can be leveraged to get 81% and 93% success rates on tasks where the original planner failed, with either one or two language corrections. Our method makes it possible to compose multiple constraints and generalizes to unseen scenes, objects, and sentences in simulated environments and real-world environments.
研究の動機と目的
- 曖昧で不十分に制約された、または誤ったゴール仕様によって引き起こされるロボット計画の失敗という課題に対処すること。
- 完全な遠隔操作や継続的なユーザーの注視を必要とせず、柔軟でリアルタイムなロボット行動の補正を可能にすること。
- 言語からコストへのマッピングをエンドツーエンドで学習することで、未観測のシーン、物体、自然言語コマンドに一般化できる手法の開発。
- 最適化ベースの計画に言語フィードバックを統合し、修正を残留コスト関数としてモデル化すること。
- 実行中に時間経過とともに複数の言語ベースの制約を組み合わせて利用できるスケーラブルで合成可能なフレームワークの提供。
提案手法
- ロボットの現在の状態と環境を条件として、視覚的観測と自然言語の修正から残留コスト関数を予測するニューラルネットワークを学習する。
- 最適化ベースの運動計画法において、言語の修正を既存のコスト関数の変更としてモデル化し、動的再計画を可能にする。
- データのデモと真値のコストマップを組み合わせて、コスト予測モデルの学習を監視する。
- 予測されたコスト関数を、衝突回避、滑らかさ、関節制限などの標準的な運動計画コストと統合し、軌道最適化を実行する。
- 実行中に時間経過とともに複数の修正を段階的に適用できるように、コスト関数を重ねて適用する。
- シミュレーションから実世界への転送を活用し、シミュレーションで学習し、新しい物体や環境にゼロショットで一般化して実ロボットマニピュレータに展開する。
実験結果
リサーチクエスチョン
- RQ1元のプランナが失敗した場合に、自然言語フィードバックを効果的に用いてロボットの運動計画を是正できるか?
- RQ2学習された言語からコストへのモデルが、未観測の物体、シーン、分布外の言語命令にどれほど一般化できるか?
- RQ3複数の言語修正を組み合わせて、段階的にロボットの行動を改善し、タスクの成功確率を向上させられるか?
- RQ4言語ベースの修正システムは、どの程度遠隔操作やキネスティックフィードバックへの依存を減らしつつ、高いパフォーマンスを維持できるか?
- RQ5シミュレーションで学習した1つのモデルが、微調整なしに実世界のロボット行動を是正できるか?
主な発見
- 1つの自然言語修正で計画失敗からの回復に81%の成功率を達成し、2つの修正では93%にまで向上。効果的な成功確率は94%から99%に向上。
- 未観測の物体や新しい環境に一般化し、視覚的および言語的入力の分布シフトに対しても頑健であることを示した。
- 組み合わせ可能で時間的に変化する修正をサポートし、複数の自然言語コマンドを用いてユーザーが段階的にロボットの行動を最適化できる。
- シミュレーションから実世界のタスクへの転送に成功し、ごみだらけのシーンやテンプレートにない自然言語を含む状況でも、再トレーニングなしに動作した。
- 元のプランナが曖昧または不十分に制約されたゴールによって失敗した場合でも、言語修正は有効であり、完全な遠隔操作なしで回復可能であった。
- 使いやすさとユーザーの注視の必要性という点で、ジョイスティックやキネスティックフィードバックといった従来の手法を上回りながら、高いタスク成功を維持した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。