[論文レビュー] OnePose++: Keypoint-Free One-Shot Object Pose Estimation without CAD Models
キーポイントなしのSfMと疎から密への2D-3Dマッチングパイプラインが、参照画像から半密なオブジェクト点群を再構成し、CADモデルなしでクエリ画像の姿勢を推定します。テクスチャ付きおよび低テクスチャのオブジェクトでワンショットの強力な結果を達成します。
We propose a new method for object pose estimation without CAD models. The previous feature-matching-based method OnePose has shown promising results under a one-shot setting which eliminates the need for CAD models or object-specific training. However, OnePose relies on detecting repeatable image keypoints and is thus prone to failure on low-textured objects. We propose a keypoint-free pose estimation pipeline to remove the need for repeatable keypoint detection. Built upon the detector-free feature matching method LoFTR, we devise a new keypoint-free SfM method to reconstruct a semi-dense point-cloud model for the object. Given a query image for object pose estimation, a 2D-3D matching network directly establishes 2D-3D correspondences between the query image and the reconstructed point-cloud model without first detecting keypoints in the image. Experiments show that the proposed pipeline outperforms existing one-shot CAD-model-free methods by a large margin and is comparable to CAD-model-based methods on LINEMOD even for low-textured objects. We also collect a new dataset composed of 80 sequences of 40 low-textured objects to facilitate future research on one-shot object pose estimation. The supplementary material, code and dataset are available on the project page: https://zju3dv.github.io/onepose_plus_plus/.
研究の動機と目的
- Repeatable image keypointsに依存しないワンショット物体姿勢推定を実現する。
- 参照ビューから正確な半密オブジェクト点群を再構築するキーポイントなしSfMパイプラインを開発する。
- テスト画像での効率的かつ正確な姿勢推定のための疎から密への2D-3Dマッチングネットワークを設計する。
- CADモデルなしのベースラインより性能を改善し、標準データセットでCADモデルベース手法と競合する結果を示す。
- 将来の一回推定姿勢推定研究を促す難易度の高い低テクスチャオブジェクトデータセットを提供する。
提案手法
- LoFTRスタイルのキーポイントなしマッチングを、粗い再構成と完全な半密点群を形成する再現性のある粗いマッチングを用いる2段階SfMフレームワークに適用する。
- 粗いトラックを各トラックに固定された参照ノードを設置し局所的なサブピクセルリファインメントを行い、再投影誤差を用いて3D点群を最適化する。
- テスト時には、クエリ画像と再構成点群の間でTransformerベースのクロスアテンションネットワークを用いて粗い2D-3Dマッチングを行い、次いで局所窓内での微細な2D-3Dマッチングを実施してPnPの正確な対応を得る。
- 長距離依存をモデル化するために2D-3Dマッチングで自己アテンションとクロスアテンションを用い、粗い段階でデュアルソフトマックスを適用して堅牢な対応を得る。
- 粗いマッチングフォーカル損失と細部の2D座標回帰損失を結合した共通損失で訓練し、SfMから投影された地真の可視2D-3D対応を使用する。
![Figure 1: Comparsion Between Our Method and OnePose [ 48 ] . For low-textured objects that are challenging for OnePose, our method can reconstruct their semi-dense point clouds with more complete geometry and thus achieves more accurate object pose estimation. Green and blue boxes represent ground t](https://ar5iv.labs.arxiv.org/html/2301.07673/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ11つの姿勢注釈付き参照画像セットから、キーポイントなしSfMパイプラインは正確で完全な半密3Dオブジェクトモデルを再構成できるか(ワンショット姿勢推定のため)?
- RQ2キーポイントなしの再構成に基づく疎から密への2D-3Dマッチングネットワークは、CADモデルなしのベースラインと比較して標準データセットで競合・優位な姿勢推定精度を達成し、CADモデルベース法に近づくか?
- RQ3提案手法は、キーポイントベースの手法が失敗する低テクスチャオブジェクトに対して頑健で、個別オブジェクトの訓練なしに未知のオブジェクトへ一般化できるか?
- RQ4粗いから細い戦略は、現実世界のAR様のシナリオにおける再構成の完全性と姿勢推定の精度にどのように影響するか?
主な発見
- OnePoseおよびOnePose-LowTextureデータセットで、既存のワンショットCADモデルなし手法を大幅に上回る。
- LINEMODではCADモデルベース手法に匹敵する結果を達成し、低テクスチャオブジェクトではキーポイントベース手法が苦戦する場面で顕著な向上を示す。
- 提案パイプラインは一部のベースラインより大幅に高速(例:V100で512x512クエリ約88ms)で、粗から細のリファインで半密再構成をより正確に提供する。
- OnePose-LowTextureではOnePoseおよびHLocより大幅な改善を示し、低テクスチャ領域への頑健性を強調する。
- LINEMODでは他のワンショットベースラインを上回り、CADモデルなし・個別オブジェクト訓練なしでもインスタンスレベルの精度に近づく。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。