[論文レビュー] Towards Large-scale 3D Representation Learning with Multi-dataset Point Prompt Training
本稿では、負の転送を軽減するためのプロンプト駆動型正規化と言語誘導型カテゴリカルアライメントを導入することで、マルチデータセット間の協調学習を可能にする、大規模3D表現学習のための新規フレームワークであるPoint Prompt Training (PPT) を提案する。PPTは、1つの共有重みモデルを用いて、屋内および屋外の多様な3Dベンチマークで最先端の性能を達成し、単一データセット学習やナードなマルチデータセット学習手法に比べて一般化性能と表現品質が顕著に向上する。
The rapid advancement of deep learning models often attributes to their ability to leverage massive training data. In contrast, such privilege has not yet fully benefited 3D deep learning, mainly due to the limited availability of large-scale 3D datasets. Merging multiple available data sources and letting them collaboratively train a single model is a potential solution. However, due to the large domain gap between 3D point cloud datasets, such mixed supervision could adversely affect the model's performance and lead to degenerated performance (i.e., negative transfer) compared to single-dataset training. In view of this challenge, we introduce Point Prompt Training (PPT), a novel framework for multi-dataset synergistic learning in the context of 3D representation learning that supports multiple pre-training paradigms. Based on this framework, we propose Prompt-driven Normalization, which adapts the model to different datasets with domain-specific prompts and Language-guided Categorical Alignment that decently unifies the multiple-dataset label spaces by leveraging the relationship between label text. Extensive experiments verify that PPT can overcome the negative transfer associated with synergistic learning and produce generalizable representations. Notably, it achieves state-of-the-art performance on each dataset using a single weight-shared model with supervised multi-dataset training. Moreover, when served as a pre-training framework, it outperforms other pre-training approaches regarding representation quality and attains remarkable state-of-the-art performance across over ten diverse downstream tasks spanning both indoor and outdoor 3D scenarios.
研究の動機と目的
- 点群データセット間の大きなドメインギャップが原因で生じるマルチデータセット3D表現学習における負の転送の課題に対処すること。
- ラベル空間の統一とドメイン固有の分布へのモデル適応を通じて、複数の3Dデータセット間での効果的な協調学習を可能にすること。
- 教師ありおよび自己教師ありの両パラダイムに対応できる普遍的な事前学習フレームワークを構築すること。
- クラスラベル間のテキスト的関係とドメイン固有のプロンプト適応を活用することで、一般化性能と表現品質を向上させること。
提案手法
- 教師ありおよび自己教師ありの両方の事前学習をサポートする、マルチデータセット3D表現学習のための統一フレームワークであるPoint Prompt Training (PPT) を導入する。
- ドメイン固有のプロンプトを適用してモデルの正規化層を異なるデータセットに適応させる、プロンプト駆動型正規化を提案する。これにより、ドメインシフトの影響を軽減する。
- クラス名のテキスト埋め込みを用いて複数のデータセットのラベル空間を統一することで、監視信号を統合する、言語誘導型カテゴリカルアライメント (LCA) を導入する。
- プロンプトアダプタとLCAを用いて、パフォーマンスの低下を伴わずにドメイン一般化を実現する、複数のデータセットで学習された共有重みモデルを採用する。
- コントラスト学習とクロスアテンション機構を活用し、統一された潜在空間内でポイント特徴とカテゴリ・テキスト埋め込みをアライメントする。
- 統合済みデータセットでの直接評価およびファインチューニングによる下流タスクへの転移学習を両方サポートする。
実験結果
リサーチクエスチョン
- RQ13D表現学習におけるマルチデータセット学習は、データセット間の大きなドメインギャップによって引き起こされる負の転送を克服できるか?
- RQ23Dポイントクラウドにおけるドメイン固有の分布シフトを、統合学習中に効果的に軽減できるか?
- RQ3単にクラス名のテキスト記述のみを用いて、多様な3Dデータセット間で統一されたラベル空間を構築できるか?
- RQ4複数のデータセットで学習された1つの共有重みモデルは、単一データセットベースラインに比べて一般化性能および下流タスク性能で優れているか?
- RQ5提案されたフレームワークは、多様な屋内および屋外3Dシナリオにおいて優れた事前学習戦略として機能できるか?
主な発見
- PPTは、複数の屋内データセットで学習された1つの共有重みモデルを用いて、ScanNetとS3DISで最先端の性能を達成した。ScanNet検証では75.4%のmIoU、テストでは77.5%を記録した。
- 屋外ベンチマークでは、SemanticKITTI(88.34% mIoU)、nuScenes(90.84% mIoU)、Waymo(94.56% mIoU)でSOTA結果を達成し、ドメインをまたがる強力な一般化性能を示した。
- PPTは、負の転送に苦しむナードな統合学習に比べて、ドメインプロンプト適応とラベル空間アライメントにより、パフォーマンスの低下を軽減し、優れた性能を実現した。
- アブレーションスタディの結果、共有ドメインプロンプトは一般化を向上させるが、ブロック単位の独立プロンプトは過学習を引き起こし、性能低下をもたらすことが確認された。
- 言語誘導型カテゴリカルアライメント (LCA) は、単一データセット学習における有効な予測ヘッドとして機能し、SpUNet-SではmIoUを73.4から74.2に向上させた。
- PPTを用いたバックボーンのスケーリングにより、過学習が軽減され、性能が向上した。SpUNet-LはS3DISで75.8%のmIoUを達成し、PPTを用いない小規模モデルを上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。