[論文レビュー] SCOOP: Self-Supervised Correspondence and Optimization-Based Scene Flow
SCOOPは、対応学習とフロー精錬を分離することで、自己教師あり3次元シーンフロー推定を実現する手法を提案する。軽量なネットワークがソフト対応を初期化するための点特徴を学習し、その後、実行時における残差フロー更新の最適化が行われる。最小限のデータで、教師なしに学習されたSCOOPは、KITTIで最先端の精度を達成しており、最適化のみのベースラインと比較して8倍高速であり、はるかに少ない学習データで教師あり手法を上回る性能を発揮する。
Scene flow estimation is a long-standing problem in computer vision, where the goal is to find the 3D motion of a scene from its consecutive observations. Recently, there have been efforts to compute the scene flow from 3D point clouds. A common approach is to train a regression model that consumes source and target point clouds and outputs the per-point translation vector. An alternative is to learn point matches between the point clouds concurrently with regressing a refinement of the initial correspondence flow. In both cases, the learning task is very challenging since the flow regression is done in the free 3D space, and a typical solution is to resort to a large annotated synthetic dataset. We introduce SCOOP, a new method for scene flow estimation that can be learned on a small amount of data without employing ground-truth flow supervision. In contrast to previous work, we train a pure correspondence model focused on learning point feature representation and initialize the flow as the difference between a source point and its softly corresponding target point. Then, in the run-time phase, we directly optimize a flow refinement component with a self-supervised objective, which leads to a coherent and accurate flow field between the point clouds. Experiments on widespread datasets demonstrate the performance gains achieved by our method compared to existing leading techniques while using a fraction of the training data. Our code is publicly available at https://github.com/itailang/SCOOP.
研究の動機と目的
- 限られたもしくは完全に存在しない真値のフローアノテーションを用いた3次元点群におけるシーンフロー推定の課題に対処すること。
- 大規模な合成データセットへの依存を減らし、小規模な実世界データセット上で効果的な学習を可能にすること。
- 対応学習とフローリファインメントの分離により、フローアクキュラシーと効率性を向上させること。
- エンドツーエンドのフローレグレッション学習を避けることで、高精度なシーンフロー推定を達成すること。
- 軽量な対応学習と効率的な実行時最適化を組み合わせることで、推論速度と精度のバランスを取ること。
提案手法
- 自己教師ありニューラルネットワークを、信頼度を考慮した距離損失を用いて、ソース点群とターゲット点群間のソフト対応のための点特徴を学習するのみに訓練する。
- フロー初期化は、各ソース点とそのソフト対応ターゲット点との差分として計算され、対応は学習済み特徴類似度に基づくターゲット点の重み付き和によって定義される。
- 推論時、自己教師ありの目的関数を用いて、残差フロー更新を直接最適化する。この目的関数は、フローの一貫性とターゲット点群への近接性を強制する。
- 滑らかさの事前分布を含む最適化目的関数により、近隣の点が類似したフローベクトルを持つように正則化され、フィールドの一貫性が向上する。
- エンドツーエンドのフローレグレッション学習を避けるために、特徴学習(トレーニング可能)とフローリファインメント(テスト時最適化)を分離する。
- 対応ネットワークから得られる信頼度スコアを、訓練中の距離損失の重み付けに用い、信頼性の高いマッチングに重点を置く。
![Figure 1 : Flow accuracy on the KITTI benchmark vs . the train set size. Our method is trained on one or two orders of magnitude less data while surpassing the performance of the competing techniques [ 20 , 25 , 29 , 37 , 17 , 18 , 36 , 4 ] by a large margin. Please see Table 1 for the complete deta](https://ar5iv.labs.arxiv.org/html/2211.14020/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ1真値のフローサポートなしに、わずかな実世界データのみで正確なシーンフロー推定が可能か?
- RQ2対応学習とフローリファインメントの分離が、性能向上とデータ依存性の低減に寄与するか?
- RQ3実行時における残差フロー更新の最適化が、エンドツーエンド学習ベースの手法を上回る精度と効率性を達成できるか?
- RQ4信頼度を考慮した対応学習が、フローチェックのロバストネスと正確性に与える影響は何か?
- RQ5リファインメント段階における最適化ステップ数を変化させた場合、推論時間と精度のトレードオフはどのように変化するか?
主な発見
- SCOOPはKITTIテストセットでEPE 0.039を達成し、最先端の教師ありおよび自己教師あり手法を上回る精度を発揮するが、学習データ量はごくわずかである。
- FT3D学習セットの10%のデータのみでSCOOPはその性能を十分に発揮し、高いデータ効率性を示している。
- SCOOP + は、フォワードネットワークのみのモデルと比較してEPEを50%以上低減し、最適化のみのNeural Prior手法と比較して8倍高速な推論を達成している。
- アブレーションスタディの結果、フローリファインメントモジュールを削除するとEPEが0.115に上昇し、これがフローや一貫性の向上に不可欠であることが確認された。
- 滑らかさ損失を除いた場合、EPEは0.056に上昇し、この正則化がロバストな点表現の学習に不可欠であることが示された。
- すべての点ではなく、最も高い輸送度を持つターゲット点のみを候補として使用することで性能が向上し、焦点を当てた対応がより良い初期化をもたらすことが示された。
![Figure 2 : Comparison of scene flow approaches. Given a pair of point clouds, FlowNet3D [ 20 ] learns to regress the flow in the free 3D space, and the trained model is frozen for testing. FLOT [ 29 ] concurrently trains two network components: one that computes point correspondence and another that](https://ar5iv.labs.arxiv.org/html/2211.14020/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。