Skip to main content
QUICK REVIEW

[論文レビュー] Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes

Alexandros Delitzas, Maria Parelli|arXiv (Cornell University)|Jun 4, 2023
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本稿では、3Dシーンの点群を、対応するCLIPで符号化されたテキストおよびマルチビュー画像の埋め込みと一致させることで、3D視覚質問応答(3D-VQA)および3D位置付き質問応答(3D-SQA)の性能を向上させる、対照的視覚言語事前学習手法であるMulti-CLIPを提案する。CLIPの事前学習済み視覚言語表現を対照的目的関数を通じて活用することにより、Multi-CLIPはScanQAおよびSQA3Dベンチマークで最先端の性能を達成し、3Dシーン特徴の意味的クラスタリングおよび移行性の向上を示している。

ABSTRACT

Training models to apply common-sense linguistic knowledge and visual concepts from 2D images to 3D scene understanding is a promising direction that researchers have only recently started to explore. However, it still remains understudied whether 2D distilled knowledge can provide useful representations for downstream 3D vision-language tasks such as 3D question answering. In this paper, we propose a novel 3D pre-training Vision-Language method, namely Multi-CLIP, that enables a model to learn language-grounded and transferable 3D scene point cloud representations. We leverage the representational power of the CLIP model by maximizing the agreement between the encoded 3D scene features and the corresponding 2D multi-view image and text embeddings in the CLIP space via a contrastive objective. To validate our approach, we consider the challenging downstream tasks of 3D Visual Question Answering (3D-VQA) and 3D Situated Question Answering (3D-SQA). To this end, we develop novel multi-modal transformer-based architectures and we demonstrate how our pre-training method can benefit their performance. Quantitative and qualitative experimental results show that Multi-CLIP outperforms state-of-the-art works across the downstream tasks of 3D-VQA and 3D-SQA and leads to a well-structured 3D scene feature space.

研究の動機と目的

  • CLIPから得られる2D視覚言語知識を蒸留することで、視覚言語タスクにおける3Dシーン理解が向上するかを調査すること。
  • 空間的・視覚的・言語的情報を統合する、転送可能で意味的に明確な3Dシーン表現を学習する課題に対処すること。
  • 3D点群特徴を、2Dマルチビュー画像およびテキスト記述の両方と、共通のCLIP埋め込み空間内で一致させる事前学習手法を開発すること。
  • 新しいマルチモーダル変換器ベースのアーキテクチャと対照的事前学習を用いて、下流の3D-VQAおよび3D-SQAタスクの性能を向上させること。

提案手法

  • 3Dスキャン内のオブジェクト特徴間の空間的関係をモデル化するため、変換器アーキテクチャに基づくマルチモーダル3Dシーンエンコーダーを提案する。
  • 同じ3Dシーンのマルチビュー画像およびテキスト記述をCLIPを用いて共通の埋め込み空間に符号化する。
  • 3Dシーン表現をCLIPで符号化された画像およびテキスト埋め込みと一致させるために、対照的学習目的を適用する。
  • 正例ペア(3Dシーンとその対応する画像およびテキスト)が負例ペアよりも埋め込み空間で近づくように促す対照的損失関数を採用する。
  • より豊かな視覚的監視を得るため、3Dシーンの5つの異なる2Dビューを生成するマルチビューレンダリング戦略を導入する。
  • 事前学習済みの3Dエンコーダー重みを下流の3D-VLAモデルに転移し、3D-VQAおよび3D-SQAデータセット上でエンドツーエンドで微調整する。

実験結果

リサーチクエスチョン

  • RQ1CLIPのような2D視覚言語モデルから得られる知識を、視覚言語タスクにおける3Dシーン理解に効果的に転送できるか?
  • RQ2CLIP空間内で3Dシーン表現を2Dマルチビュー画像およびテキストの両方と一致させることで、3D-VQAおよび3D-SQAにおける一般化性能と性能が向上するか?
  • RQ33Dシーンの複数のビューは、学習された3D表現の頑健性および品質にどのように寄与するか?
  • RQ4この3D視覚言語事前学習設定において、対照的学習はコサイン類似度などの代替一致目的よりも効果的か?
  • RQ5マルチブランチ対照的損失(テキスト、画像、3D-3D)のどのコンponentが下流性能にとって最も重要か?

主な発見

  • 前回の最先端手法と比較して、ScanQAベンチマークにおいてAcc@0.25で3.03%の絶対的向上、Acc@0.50で2.83%の向上を達成した。
  • 学習からゼロで開始する手法やScanQAベースラインを上回り、事前学習戦略の有効性を示している。
  • SQA3Dベンチマークでは、EM@1スコアが48.02%に達し、学習からゼロで開始する手法やアブレーションバージョンを明確に上回った。
  • アブレーションスタディの結果、複数のビューを使用することで性能が向上し、単一ビュー学習と比較して0.18%の向上を示した。
  • テキストまたは画像の対照的損失項を削除すると性能が低下し、両モodalの共同監視の重要性が裏付けられた。
  • t-SNE可視化では、事前学習済みの3Dシーン特徴が意味的に整合性のあるクラスタを形成しており、構造的かつ意味的な特徴学習が行われていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。