Skip to main content
QUICK REVIEW

[論文レビュー] CLIP2Point: Transfer CLIP to Point Cloud Classification with Image-Depth Pre-training

Tianyu Huang, Bowen Dong|arXiv (Cornell University)|Oct 3, 2022
Advanced Vision and Imaging被引用数 14
ひとこと要約

CLIP2Pointは、ShapeNetの3Dモデルからレンダリングされた52,460組の画像-深度ペアを用いて対照的学習により深度エンコーダーを訓練することで、CLIPの視覚言語知識を3次元点群分類に転送する、画期的な画像-深度事前学習手法を提案する。Gated Dual-Path Adapterを用いてCLIPとCLIP2Pointの特徴を効率的に統合することで、ゼロショット、フェイントショット、完全教師ありの点群分類において最先端の性能を達成した。

ABSTRACT

Pre-training across 3D vision and language remains under development because of limited training data. Recent works attempt to transfer vision-language pre-training models to 3D vision. PointCLIP converts point cloud data to multi-view depth maps, adopting CLIP for shape classification. However, its performance is restricted by the domain gap between rendered depth maps and images, as well as the diversity of depth distributions. To address this issue, we propose CLIP2Point, an image-depth pre-training method by contrastive learning to transfer CLIP to the 3D domain, and adapt it to point cloud classification. We introduce a new depth rendering setting that forms a better visual effect, and then render 52,460 pairs of images and depth maps from ShapeNet for pre-training. The pre-training scheme of CLIP2Point combines cross-modality learning to enforce the depth features for capturing expressive visual and textual features and intra-modality learning to enhance the invariance of depth aggregation. Additionally, we propose a novel Dual-Path Adapter (DPA) module, i.e., a dual-path structure with simplified adapters for few-shot learning. The dual-path structure allows the joint use of CLIP and CLIP2Point, and the simplified adapter can well fit few-shot tasks without post-search. Experimental results show that CLIP2Point is effective in transferring CLIP knowledge to 3D vision. Our CLIP2Point outperforms PointCLIP and other self-supervised 3D networks, achieving state-of-the-art results on zero-shot and few-shot classification.

研究の動機と目的

  • CLIPの画像事前学習と3次元点群タスクの間のドメインギャップを埋める。これは、3次元言語事前学習データが限られていることが原因である。
  • 深度マップを介してCLIPの視覚言語知識を3次元に適応させることで、ゼロショットおよびフェイントショットの点群分類を改善する。
  • 深度特徴をCLIPの視覚特徴と整合させつつ、多視点変化に対して不変性を維持する事前学習スキームを開発する。
  • 下流の3次元タスクに適したCLIPとCLIP2Pointの表現を統合する効率的なアダプタモジュールを設計する。

提案手法

  • ShapeNetの3Dモデルからレンダリングされた52,460組のマルチビュー画像-深度ペアを用いて、対照的学習により深度エンコーダーを事前学習する。
  • クロスモodal対照的学習を採用し、深度特徴をCLIPの画像特徴と整合させることでドメインギャップを低減する。
  • 深度マップ上でイントラモダリティ対照的学習を適用し、視点変化に対して不変性を高め、特徴の一貫性を向上させる。
  • CLIPの学習分布に近い視覚的にリアルな深度マップを生成するために、最小深度値と拡張率を用いた新しい深度レンダリング設定を導入する。
  • CLIPとCLIP2Pointの両方のエンコーダーを備えた2本の並列パスを持つGated Dual-Path Adapter (GDPA) を提案。各パスにはグローバルビュー集約器と学習可能なゲーテッド統合が備わる。
  • 固定されたCLIP画像エンコーダーと、事前学習中に微調整される深度エンコーダーを用い、下流の3次元タスクへの知識転送を可能にする。

実験結果

リサーチクエスチョン

  • RQ1画像-深度ペアにおける対照的学習が、CLIPの視覚言語知識を3次元点群分類に効果的に転送できるか?
  • RQ2深度レンダリング設定の選択が、下流の3次元分類タスクの性能にどのように影響するか?
  • RQ3ゲーテッド統合を備えた二重パスアダプタが、CLIPとCLIP2Pointの特徴を統合することで、どの程度特徴表現を向上させられるか?
  • RQ4ShapeNetからの合成深度マップで事前学習したモデルが、現実世界の3次元ビジョンベンチマークに一般化できるか?
  • RQ5ゼロショット、フェイントショット、完全教師ありの設定において、CLIP2Pointは既存の3次元転移学習および事前学習手法と比較してどのように優れているか?

主な発見

  • CLIP2Pointは、ModelNet10、ModelNet40、ScanObjectNNの3次元点群分類において、ゼロショット、フェイントショット、完全教師ありの全設定で最先端の性能を達成した。
  • 最小深度値レンダリング設定では、ModelNet10で24.87%のゼロショット精度を達成し、重み付け深度設定(16.86%)を8ポイント以上上回った。
  • 深度レンダリングで拡張率を2に設定すると最良のバランスが得られ、29.71%のゼロショット精度を達成した。一方、より高い率(R=4)ではぼやけが生じ、性能が低下した。
  • Gated Dual-Path Adapterを用いることで、ModelNet10におけるフェイントショット精度が89.79%に向上し、単一パスベースラインやアブレーションバージョンを顕著に上回った。
  • 特徴可視化の結果、CLIP2Pointによる事前学習が、ベースライン手法と比較して特徴空間におけるクラス分離性が向上していることが確認された。
  • 事前学習済みの深度エンコーダーとCLIPエンコーダーを備えた二重パス構造は、両方のパスをCLIPのみで初期化した場合(87.20%対87.46%)よりも高い精度を達成し、補完的知識統合の有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。