[論文レビュー] Self-Supervised Geometric Correspondence for Category-Level 6D Object Pose Estimation in the Wild
本論文は、人間によるアノテーションやシミュレーテッド6次元姿勢ラベルを必要としない、現実世界(in-the-wild)の画像におけるカテゴリーレベル6次元オブジェクトポーズ推定の自己教師付きフレームワークを提案する。Categorical Surface Embedding (CSE) を導入して、密な2D-3D幾何的対応関係を学習し、2D-3D空間、異なるインスタンス、時間ステップの間で新たなサイクル整合性損失を採用することで、Wild6DおよびREAL275で最先端の性能を達成した。
While 6D object pose estimation has wide applications across computer vision and robotics, it remains far from being solved due to the lack of annotations. The problem becomes even more challenging when moving to category-level 6D pose, which requires generalization to unseen instances. Current approaches are restricted by leveraging annotations from simulation or collected from humans. In this paper, we overcome this barrier by introducing a self-supervised learning approach trained directly on large-scale real-world object videos for category-level 6D pose estimation in the wild. Our framework reconstructs the canonical 3D shape of an object category and learns dense correspondences between input images and the canonical shape via surface embedding. For training, we propose novel geometrical cycle-consistency losses which construct cycles across 2D-3D spaces, across different instances and different time steps. The learned correspondence can be applied for 6D pose estimation and other downstream tasks such as keypoint transfer. Surprisingly, our method, without any human annotations or simulators, can achieve on-par or even better performance than previous supervised or semi-supervised methods on in-the-wild images. Our project page is: https://kywind.github.io/self-pose .
研究の動機と目的
- 3次元アノテーションが乏しいもしくは利用できない現実世界の設定において、カテゴリーレベル6次元オブジェクトポーズ推定の課題に対処すること。
- 合成データや人間によるアノテーションに依存せず、大規模なラベルなし現実世界動画を直接学習することで、シミュレーションから現実へのドメインギャップを克服すること。
- いかなる教師信号も用いずに、キャノニカル3次元形状プリオリと画像間の密な2D-3D幾何的対応関係を学習すること。
- 2Dおよび3D空間、異なるオブジェクトインスタンス、時間的シーケンスの間で幾何的整合性を強制する、新たなサイクル整合性損失を開発すること。
- 自己教師付き表現学習により、未学習のオブジェクトインスタンスやin-the-wildな環境へのゼロショット一般化を可能にすること。
提案手法
- 各オブジェクトカテゴリに対して、キャノニカル3次元メッシュの表面に定義された学習可能な特徴フィールドとして、Categorical Surface Embedding (CSE) を導入する。
- ビジョントランスフォーマーのエンコーダーを用いて画像特徴を抽出し、CSEとの類似度を計算することで、密な2D-3D幾何的対応関係を確立する。
- 2D-3Dサイクル整合性損失を定式化:2Dピクセルを対応関係を通じて3D頂点にマッピングし、剛体変換を用いて再び2Dに投影する。再構築された2D位置が元の位置と一致するようにする。
- インスタンス間サイクル整合性を導入:1つのインスタンス内の2Dピクセルを3Dにマッピングし、キャノニカル空間における別のインスタンスに変換し、2Dに再投影する。DINO特徴を用いてインスタンス間の対応関係を検証する。
- 時間的サイクル整合性を導入:連続する動画フレームにおける同じオブジェクトを別インスタンスとして扱い、対応関係学習における時間的整合性を強制する。
- マルチタスク損失を用いて学習:RGB、深度、セグメンテーションの再構成損失に加え、提案されたサイクル整合性損失および深度監督損失を組み合わせる。
実験結果
リサーチクエスチョン
- RQ16次元姿勢アノテーションが一切ない状況でも、自己教師付き手法が正確な2D-3D幾何的対応関係を学習できるか?
- RQ22D-3D空間、異なるインスタンス、時間ステップの間で、サイクル整合性損失が対応関係学習およびポーズ推定精度をどれほど向上させるか?
- RQ3完全にラベルなしの現実世界動画での学習に限って、未学習の環境や制約のない環境への一般化性能が、教師ありまたは半教師ありベースラインと比べてどの程度優れているか?
- RQ4提案されたCategorical Surface Embedding (CSE) 表現は、構造的な3次元特徴符号化なしに直接2D-3Dマッピングを行う手法を上回るか?
- RQ5深度監督とマルチレベルのサイクル整合性を統合することで、形状や外観の変動に対するロバストネスがどのように向上するか?
主な発見
- 提案された自己教師付き手法は、合成データや人間による6次元姿勢ラベルに依存する教師あり・半教師あり手法を上回るか同等の性能をWild6Dベンチマークで達成した。
- Wild6Dでは、IOU 0.25で92.3%のmAP、IOU 0.5で68.2%のmAP、5° 5cmで35.3%のmAPを達成し、重要なコンponentsを欠いたアブレーションと比較して顕著に優れた性能を示した。
- アブレーションスタディの結果、インスタンス間および時間的サイクル整合性損失を削除すると、IOU 0.5でのmAPが5.2%低下し、これらが意味的認識可能な対応関係を学習する上で不可欠であることが示された。
- インスタンス間および時間的サイクル整合性損失を併用することで、ラップトップカテゴリで5° 5cmのmAPが5.8%向上し、CUBデータセットでは30.6%向上した。これは顕著な一般化性能の向上を示している。
- 深度損失は深度に敏感なカテゴリにおいて極めて重要である:深度損失を削除すると、IOU 0.5でのmAPが15.6ポイント低下し、ずれの低減に果たす役割が明確になった。
- CSE表現は不可欠である:表面埋め込みなしのアブレーションでは、IOU 0.5でのmAPが68.2%から57.1%に低下し、構造的な3次元特徴符号化が性能向上の鍵であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。