Skip to main content
QUICK REVIEW

[論文レビュー] OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics

Peiqi Liu, Yaswanth Orru|arXiv (Cornell University)|Jan 22, 2024
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

OK-Robot は、視覚言語モデル(VLMs)と事前学習済みのナビゲーションおよび grasping プリミティブを統合することで、非構造的な家庭環境におけるオープンボリューム pick-and-drop タスクを実行するゼロショット、オープンナレッジロボティクスフレームワークを提案する。訓練を一切行わず、10軒の実際の家庭で58.5%の成功率を達成し、より綺麗な環境では82%に上昇する。これは、コンponent統合とシステムレベルのヒューリスティクスがパフォーマンスに重要であることを示している。

ABSTRACT

Remarkable progress has been made in recent years in the fields of vision, language, and robotics. We now have vision models capable of recognizing objects based on language queries, navigation systems that can effectively control mobile systems, and grasping models that can handle a wide range of objects. Despite these advancements, general-purpose applications of robotics still lag behind, even though they rely on these fundamental capabilities of recognition, navigation, and grasping. In this paper, we adopt a systems-first approach to develop a new Open Knowledge-based robotics framework called OK-Robot. By combining Vision-Language Models (VLMs) for object detection, navigation primitives for movement, and grasping primitives for object manipulation, OK-Robot offers a integrated solution for pick-and-drop operations without requiring any training. To evaluate its performance, we run OK-Robot in 10 real-world home environments. The results demonstrate that OK-Robot achieves a 58.5% success rate in open-ended pick-and-drop tasks, representing a new state-of-the-art in Open Vocabulary Mobile Manipulation (OVMM) with nearly 1.8x the performance of prior work. On cleaner, uncluttered environments, OK-Robot's performance increases to 82%. However, the most important insight gained from OK-Robot is the critical role of nuanced details when combining Open Knowledge systems like VLMs with robotic modules. Videos of our experiments and code are available on our website: https://ok-robot.github.io

研究の動機と目的

  • 非構造的な家庭環境におけるゼロショットオープンボリュームモバイル操作を可能にする汎用ロボティクスフレームワークの開発。
  • 事前学習済みのオープンナレッジモデル(VLMs、ナビゲーション、grasping)が、タスク固有の微調整なしに効果的に統合できるかの調査。
  • 視覚、ナビゲーション、grasping モジュールのコンponentレベルの不正確さに起因するシステムレベルの障害モードを特定・解決すること。
  • 多様で未確認の家庭における実世界のデプロイメントを用いて、オープンボリュームモバイル操作(OVMM)のベンチマークを確立すること。
  • 再現可能性と拡張性を支援するため、コードとモジュールをオープンソース化して将来的な研究を支援すること。

提案手法

  • OK-Robot は、新しい住宅のスキャンデータ(iPhone から取得)を用いて、LangSam および CLIP を用いて視覚言語表現の高密度なセマンティックメモリを構築する。
  • 自然言語クエリを言語埋め込みを用いてセマンティックメモリ内のオブジェクトと照合することで、オープンボリュームオブジェクトロケーションを実現する。
  • VLM の出力から得られるターゲット位置に到達するため、A*-ベースのパスプランナ(USANet に類似)を用いてナビゲーションを実行する。
  • 再トレーニングなしに、検出されたオブジェクト位置に対して直接作用する事前学習済みのgraspingポリシーを用いてgraspingを実行する。
  • ステートマシンコントローラーが、オブジェクトロケーション、ナビゲーション、grasping プリミティブをモジュラーかつゼロショットのパイプラインとして順次実行する。
  • 衝突回避や物理的制約に基づくグリップポーズの調整など、ロボット固有の制限を処理するためにヒューリスティクスを適用する。
Figure 2: Open-vocabulary, open knowledge object localization and navigation in the real-world. We use the VoxelMap [ 25 ] for localizing objects with natural language queries, and use an A* algorithm similar to USANet [ 26 ] for path planning.
Figure 2: Open-vocabulary, open knowledge object localization and navigation in the real-world. We use the VoxelMap [ 25 ] for localizing objects with natural language queries, and use an A* algorithm similar to USANet [ 26 ] for path planning.

実験結果

リサーチクエスチョン

  • RQ1実際の家庭環境におけるゼロショット統合のVLMs、ナビゲーション、grasping モデルが、オープンボリュームモバイル操作にどの程度効果的か。
  • RQ2個々のモデルの正確性とは独立して、コンポonentの組み合わせ方やヒューリスティクスといったシステムレベルの設計選択が全体の成功に果たす役割は何か。
  • RQ3ごみの多さ、透明性、オブジェクトのサイズといった環境要因が、オープンナレッジロボティクスシステムのパフォーマンスにどのように影響するか。
  • RQ4エラー検出の向上、リトライメカニズム、またはユーザインタラクションを通じて、障害モードをどの程度軽減できるか。
  • RQ5現在のオープンナレッジロボティクスパイプラインにおける主なボトル neck は何か。今後のモデルやハードウェアの改善によって、それらはどのように解決できるか。

主な発見

  • OK-Robot は、10軒の実際の未確認の家庭環境において、オープンエンドのピックアンドドロップタスクで58.5%の成功率を達成し、オープンボリュームモバイル操作(OVMM)分野における新たな最先端水準を確立した。
  • より綺麗でごみの少ない環境では、成功率が82.4%に上昇し、環境の質がシステムパフォーマンスに与える強い影響を示している。
  • CLIP や OWL-ViT などの事前学習済みVLMs は、セマンティックメモリと言語マッチングを組み合わせることで、ゼロショットでのオブジェクトロケーションとナビゲーションに効果的に機能する。
  • 事前学習済みのgraspingモデルは微調整なしに直接適用可能であり、未確認の家庭環境に対しても良好に一般化されることを示している。
  • 特にロボットの運動学的制約や物理的制約を処理するためのヒューリスティクスの活用が、単純なコンponentの積み重ねよりも顕著に成功率を向上させている。
  • コンponent間の障害蓄積は依然として大きな課題であり、80%の正確性を持つコンponentですら、乗法的エラー効果により全体の成功率が60%未満に低下する可能性がある。
Figure 3: Open-vocabulary grasping in the real world. From left to right, we show the (a) robot POV image, (b) all suggested grasps from AnyGrasp [ 19 ] , (c) object mask given label from LangSam [ 24 ] , (d) grasp points filtered by the mask, and (e) grasp chosen for execution.
Figure 3: Open-vocabulary grasping in the real world. From left to right, we show the (a) robot POV image, (b) all suggested grasps from AnyGrasp [ 19 ] , (c) object mask given label from LangSam [ 24 ] , (d) grasp points filtered by the mask, and (e) grasp chosen for execution.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。