[論文レビュー] ZeroPose: CAD-Prompted Zero-shot Object 6D Pose Estimation in Cluttered Scenes
ZeroPoseは、CADモデルと視覚的基礎モデル(SAMおよびImageBind)を活用して、未学習の物体に対してトレーニングを一切行わずにインスタンスレベルのセグメンテーションとポーズ推定を実現する完全なゼロショット6次元物体ポーズ推定パイプラインを提案する。BOPベンチマークにおいて25.0%の平均平均リCALL(AR)を達成し、Megaposeなど先行手法よりも8.6%高い性能を発揮しながらも、高い効率性を維持している。
Many robotics and industry applications have a high demand for the capability to estimate the 6D pose of novel objects from the cluttered scene. However, existing classic pose estimation methods are object-specific, which can only handle the specific objects seen during training. When applied to a novel object, these methods necessitate a cumbersome onboarding process, which involves extensive dataset preparation and model retraining. The extensive duration and resource consumption of onboarding limit their practicality in real-world applications. In this paper, we introduce ZeroPose, a novel zero-shot framework that performs pose estimation following a Discovery-Orientation-Registration (DOR) inference pipeline. This framework generalizes to novel objects without requiring model retraining. Given the CAD model of a novel object, ZeroPose enables in seconds onboarding time to extract visual and geometric embeddings from the CAD model as a prompt. With the prompting of the above embeddings, DOR can discover all related instances and estimate their 6D poses without additional human interaction or presupposing scene conditions. Compared with existing zero-shot methods solved by the render-and-compare paradigm, the DOR pipeline formulates the object pose estimation into a feature-matching problem, which avoids time-consuming online rendering and improves efficiency. Experimental results on the seven datasets show that ZeroPose as a zero-shot method achieves comparable performance with object-specific training methods and outperforms the state-of-the-art zero-shot method with 50x inference speed improvement.
研究の動機と目的
- 産業用ロボットやAR応用分野において、未学習の物体に適用する際のスケーラビリティと高いトレーニングコストという課題に対処すること。
- 微調整や再トレーニングを一切行わず、CADモデルのみを入力として用いて、新しい物体の正確な6次元ポーズ推定を可能にすること。
- 視覚的および幾何的プライオリティを活用して、ゼロショットインスタンスセグメンテーションとゼロショットポーズ推定を実行する2段階パイプラインの開発。
- レンダリングされたポーズ仮説の生成や教師ありインスタンス検出の必要性を排除することで、ごみが多いシーンでも効率的かつ頑健な性能を向上させること。
- 実世界の多様な未学習の物体に一般化可能な完全なゼロショットフレームワークを確立すること。
提案手法
- 2段階パイプライン:まず、SAMを用いて候補マスクを生成し、ImageBindを用いてレンダリングされたCADビューからの視覚的埋め込みを抽出してマッチングを行うことで、ゼロショットインスタンスセグメンテーションを実現。
- 候補画像特徴と事前に抽出されたCADモデル特徴の間でコサイン類似度による視覚的記述子マッチングを実施し、セグメンテーションされたインスタンスにオブジェクトIDを割り当てる。
- 3次元点群を直接CADモデルの3次元幾何構造と照合することで、6次元ポーズを推定する軽量な階層的幾何構造マッチングモジュール。
- ノイズの多い点をオブジェクト半径のしきい値を用いてフィルタリングした後、RANSACベースのICPに類似したマッチングを用いて3次元点対応からポーズ推定を実行。
- モデルの微調整なしに推論時のみで動作する。CADモデルと視覚的基礎モデルに依存する。
- パイプラインは、CADモデル点の均一サンプリングと深度投影を用いてシーンの点群を生成するPyTorch風擬似コード実装を採用。
実験結果
リサーチクエスチョン
- RQ1CADモデルに基づくゼロショットポーズ推定パイプラインは、未学習の物体に対してトレーニングを一切行わずに高い精度を達成できるか?
- RQ2SAMやImageBindのような視覚的基礎モデルを効果的に組み合わせることで、新しい物体のゼロショットインスタンスセグメンテーションが可能になるか?
- RQ32次元-2次元対応に基づくレンダリング手法と比較して、直接的な3次元-3次元幾何構造マッチングが精度と効率性の面で優れているか?
- RQ4ごみが多いシーン条件下で、MegaposeのようなSOTA手法と比較して、本手法はゼロショットポーズ推定において優れた性能を示すか?
- RQ5BOPベンチマークデータセットにおいて、多様で未学習のオブジェクトに対してパイプラインは高い性能を維持できるか?
主な発見
- 提案されたゼロショットインスタンスセグメンテーション手法は、教師ありのMaskRCNNと同等の性能を達成し、BOPベンチマークで17.7%の平均平均リCALL(AR)を記録した。
- ゼロショットポーズ推定器は、7つのBOPコアデータセットで平均25.0%のARを達成し、Megaposeを8.6ポイント上回った。
- LM-OおよびT-LESSデータセットでは、点群の信号対ノイズ比が低いため、ノイズの多い幾何構造が生じ、精度が低下した。
- Megaposeがオンラインレンダリングとマッチングに依存するのに対し、本手法はポーズ仮説の生成を回避することで、優れた効率性を示した。
- リアルタイム産業用途に適した高速な推論を維持しながら、ゼロショットポーズ推定分野でSOTAの結果を達成した。
- 視覚的基礎モデルとCAD幾何構造の統合により、多様で未学習のオブジェクトにわたる頑健で一般化可能なポーズ推定が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。