Skip to main content
QUICK REVIEW

[論文レビュー] Open-Vocabulary 3D Detection via Image-level Class and Debiased Cross-modal Contrastive Learning

Yuheng Lu, Chenfeng Xu|arXiv (Cornell University)|Jul 5, 2022
Advanced Neural Network Applications被引用数 8
ひとこと要約

本稿では、ImageNet1Kの画像レベルのカテゴリラベルを活用して、未学習のオブジェクトカテゴリを認識できる点群検出器を可能にする、新規のオープンボリューム3Dオブジェクト検出フレームワークOV-3DETICを提案する。画像ベースの疑似ラベル付けとデバイアス除去型クロスモodalな対照的学習戦略を組み合わせることで、SUN-RGBDでベースラインモデル比最大10.77%、ScanNetで9.56%のmAP向上を達成し、推論遅延を増加させずに実現した。

ABSTRACT

Current point-cloud detection methods have difficulty detecting the open-vocabulary objects in the real world, due to their limited generalization capability. Moreover, it is extremely laborious and expensive to collect and fully annotate a point-cloud detection dataset with numerous classes of objects, leading to the limited classes of existing point-cloud datasets and hindering the model to learn general representations to achieve open-vocabulary point-cloud detection. As far as we know, we are the first to study the problem of open-vocabulary 3D point-cloud detection. Instead of seeking a point-cloud dataset with full labels, we resort to ImageNet1K to broaden the vocabulary of the point-cloud detector. We propose OV-3DETIC, an Open-Vocabulary 3D DETector using Image-level Class supervision. Specifically, we take advantage of two modalities, the image modality for recognition and the point-cloud modality for localization, to generate pseudo labels for unseen classes. Then we propose a novel debiased cross-modal contrastive learning method to transfer the knowledge from image modality to point-cloud modality during training. Without hurting the latency during inference, OV-3DETIC makes the point-cloud detector capable of achieving open-vocabulary detection. Extensive experiments demonstrate that the proposed OV-3DETIC achieves at least 10.77 % mAP improvement (absolute value) and 9.56 % mAP improvement (absolute value) by a wide range of baselines on the SUN-RGBD dataset and ScanNet dataset, respectively. Besides, we conduct sufficient experiments to shed light on why the proposed OV-3DETIC works.

研究の動機と目的

  • 既存の点群検出器が学習語彙に含まれないクラスに対して失敗するという、オープンボリューム3Dオブジェクト検出の課題に対処すること。
  • 大規模かつ完全にアノテートされた3D点群データセットの不足を補うために、ImageNet1Kの豊富な画像レベルのカテゴリラベルを活用すること。
  • 未学習クラスの3Dアノテーションを一切必要とせず、画像モダリティから点群モダリティへの知識の転移を実現する手法を開発すること。
  • 未学習のオブジェクトカテゴリへの一般化性能を向上させつつ、推論遅延を低く保つこと。

提案手法

  • 2段階のトレーニングパイプラインを採用:まず、ImageNet1Kの画像レベルの監視情報を用いて、2D画像検出器が未学習カテゴリの3D点群に疑似バウンディングボックスとカテゴリラベルを生成する。
  • モダリティバイアスを低減しつつ、画像と点群の特徴を整列させるデバイアス除去型クロスモダリティ対照的学習目的関数を導入し、距離に応じた温度戦略を用いる。
  • 対照的損失は、ImageNet1Kの画像特徴と疑似ラベル付き点群特徴の間に適用され、汎用的で共有される表現を学習するようモデルを促進する。
  • 線形投影ヘッドを用いて特徴を共有埋め込み空間に射影し、検出ヘッドと同時にエンドツーエンドで対照的損失を最適化する。
  • 限られた監視情報のもとでも、3D検出器の強力な局所化一般化能力を活用して、未学習クラスの信頼性の高い疑似ラベルを生成する。
  • 追加の3Dアノテーションや2D検出アノテーションを一切必要とせず、ImageNet1Kの画像レベルカテゴリラベルに依存する。

実験結果

リサーチクエスチョン

  • RQ1ImageNet1Kのような大規模データセットの画像レベルの監視情報を、未学習クラスの3Dアノテーションを一切必要とせずに、オープンボリューム3D検出に効果的に活用できるか?
  • RQ2画像から点群への知識転移を実現するにあたり、クロスモダリティ対照的学習をどのように設計すればモダリティバイアスを最小限に抑えることができるか?
  • RQ32D検出器からの疑似ラベル付けが、未学習カテゴリの3D検出性能にどの程度向上効果をもたらすか?
  • RQ43D検出器の局所化能力は、データが少ない状況でも、信頼性の高い疑似ラベル付けを支えるのに十分に一般化できるか?
  • RQ5デバイアス除去型対照的学習は、異なるモダリティ間の特徴整列と一般化を向上させるにあたり、どのような役割を果たすか?

主な発見

  • OV-3DETICは、強力なベースラインモデルに対してSUN-RGBDデータセットで10.77%の絶対的mAP向上を達成し、オープンボリューム検出における顕著な性能向上を示した。
  • ScanNetデータセットでも、ベースラインモデル比9.56%の絶対的mAP向上を達成し、異なるベンチマークでも有効性を確認した。
  • アブレーションスタディの結果、疑似ラベル付け、クラスベースの対照的学習、距離に応じた温度スケジューリングが、順次的に未学習クラスの特徴クラスタリングを改善した。
  • 特徴可視化により、デバイアス除去型対照的学習戦略が、特に未学習カテゴリにおいて画像と点群の特徴分布を近づけていることが確認された。
  • AR25指標は、画像データよりも点群データでより速く収束したため、3D検出器の局所化一般化能力が強く、疑似ラベル付けの実用性を裏付けた。
  • 50エポックごとの疑似ラベルの段階的精錬により、一貫した性能向上が得られたことから、より良い疑似ラベルがより良い検出結果をもたらすことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。