Skip to main content
QUICK REVIEW

[論文レビュー] StructFormer: Learning Spatial Structure for Language-Guided Semantic Rearrangement of Novel Objects

Weiyu Liu, Chris Paxton|arXiv (Cornell University)|Oct 19, 2021
Robot Manipulation and Learning被引用数 7
ひとこと要約

本稿では、空間的構造と複数対象の関係的制約を同時に考慮することで、言語誘導型の意味的再配置を実現するトランスフォーマー基盤モデル、StructFormerを提案する。本モデルは、円やテーブルセッティングなどの複雑な配置をシミュレーションで58%の成功率で達成し、ペairwise関係ベースラインより複雑な構造で52%の性能向上を達成するとともに、不要な物体の操作を19%削減した。

ABSTRACT

Geometric organization of objects into semantically meaningful arrangements pervades the built world. As such, assistive robots operating in warehouses, offices, and homes would greatly benefit from the ability to recognize and rearrange objects into these semantically meaningful structures. To be useful, these robots must contend with previously unseen objects and receive instructions without significant programming. While previous works have examined recognizing pairwise semantic relations and sequential manipulation to change these simple relations none have shown the ability to arrange objects into complex structures such as circles or table settings. To address this problem we propose a novel transformer-based neural network, StructFormer, which takes as input a partial-view point cloud of the current object arrangement and a structured language command encoding the desired object configuration. We show through rigorous experiments that StructFormer enables a physical robot to rearrange novel objects into semantically meaningful structures with multi-object relational constraints inferred from the language command.

研究の動機と目的

  • ロボットが円、線、塔、テーブルセッティングなどの複雑で意味的な空間的構造に新規の物体を再配置できるようにすること。
  • 未確認の物体や不要な物体を含む非構造的環境における言語誘導型操作の課題に対処すること。
  • 2対の空間的関係に依存するのではなく、複数対象の関係的制約を統合的に推論する計画システムを開発すること。
  • 物体固有のモデルや大規模な再プログラミングを必要とせず、物体タイプや構造に一般化できるシステムを構築すること。
  • シミュレーションおよび実機ロボットを用いた実験により、実世界への適用可能性を検証すること。

提案手法

  • StructFormerは、現在の物体配置の3次元ポイントクラウドと、望ましい配置を記述する構造化された言語命令を、トランスフォーマーのエンコーダーで同時に符号化する。
  • モデルは、言語命令内の参照表現(直接的および関係的参照を含む)に基づき、どの物体を移動すべきかを予測する。
  • 自己回帰型トランスフォーマーのデコーダーが、選択された各物体の目標3次元ポーズを段階的に生成することで、物体配置の順次予測を可能にする。
  • 335体の実世界の物体モデルを用いて、4種類の構造(円、線、塔、テーブルセッティング)の手続き的生成データセットを用いてモデルを学習する。
  • 物体選択とポーズ生成は分離されている:物体選択ネットワークが関連する物体を特定し、ポーズ生成ネットワークがそれらの空間的配置を計画する。
  • 本システムは、RGB-Dセンシングを備えたFranka Pandaロボットに実装されており、学習済みのグリッピングとRRT-connectを用いた運動計画が実行されている。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークが、複数対象の空間的関係と言語命令を同時に推論することで、新規の物体に対する有効な意味的再配置を生成できるか?
  • RQ2円やテーブルセッティングのような複雑な空間的構造をモデル化する場合、2対の空間的関係に依存する手法と比較して、成功率と頑健性にどのような差が生じるか?
  • RQ3再トレーニングを伴わず、新規の物体や未確認の配置にどの程度一般化できるか?
  • RQ4再配置中に不要な物体の操作をどの程度効果的に低減できるか?
  • RQ5本システムは、実世界の非構造的環境において実機ロボットでも信頼性のある性能を発揮できるか?

主な発見

  • 完全なシステムは156のテストシーンにおいて、シミュレーションで37%の成功率(156中58件=37%)を達成した。
  • 複数対象の推論を要する複雑な構造(円とテーブルセッティング)において、Binaryベースラインより52%の性能向上(112件中58件の成功)を達成した。
  • 単純な構造(線と塔)においては、Binaryベースラインより15%の成功率向上(95件中14件の追加成功)を達成した。
  • 平均的な不要な物体の操作回数を19%削減(1エピソードあたり0.17 vs. 0.21)し、ごみ混じりのシーンでも関連性の高いフィルタリングが可能であることが示された。
  • 実機ロボット実験では、本システムは実世界のFranka Pandaロボット上で再配置を正常に実行したが、失敗の主な要因は物体認識の誤りと到達不能なポーズに起因した。
  • 物体選択ネットワークは61%のシーンですべてのクエリ対象を正しく特定し、83%のシーンで指定された物体の70%を正しく特定した。これは、参照表現の根拠付けにおいて高い頑健性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。