[論文レビュー] 3D Concept Grounding on Neural Fields
本稿では、質問応答の監視により、セマンティックおよびインスタンスセグメンテーションを同時に学習することで、3Dコンセプトグラウンディングを実現する、新しいフレームワーク3D-CGを提案する。3D座標の記述子と言語コンセプトの埋め込みベクトルとの間のベクトル類似度を計算することで、エンドツーエンドで微分可能なセグメンテーションと推論を可能にする。従来の教師なしおよび言語媒介型モデルに比べ、セグメンテーションおよび視覚的推論の両タスクで優れた性能を発揮し、未観測の形状や実スキャンに対しても良好な一般化性能を示す。
In this paper, we address the challenging problem of 3D concept grounding (i.e. segmenting and learning visual concepts) by looking at RGBD images and reasoning about paired questions and answers. Existing visual reasoning approaches typically utilize supervised methods to extract 2D segmentation masks on which concepts are grounded. In contrast, humans are capable of grounding concepts on the underlying 3D representation of images. However, traditionally inferred 3D representations (e.g., point clouds, voxelgrids, and meshes) cannot capture continuous 3D features flexibly, thus making it challenging to ground concepts to 3D regions based on the language description of the object being referred to. To address both issues, we propose to leverage the continuous, differentiable nature of neural fields to segment and learn concepts. Specifically, each 3D coordinate in a scene is represented as a high-dimensional descriptor. Concept grounding can then be performed by computing the similarity between the descriptor vector of a 3D coordinate and the vector embedding of a language concept, which enables segmentations and concept learning to be jointly learned on neural fields in a differentiable fashion. As a result, both 3D semantic and instance segmentations can emerge directly from question answering supervision using a set of defined neural operators on top of neural fields (e.g., filtering and counting). Experimental results show that our proposed framework outperforms unsupervised/language-mediated segmentation models on semantic and instance segmentation tasks, as well as outperforms existing models on the challenging 3D aware visual reasoning tasks. Furthermore, our framework can generalize well to unseen shape categories and real scans.
研究の動機と目的
- 2Dセグメンテーションに基づく視覚的推論の限界、特に遮蔽下での失敗や未学習のコンセプトへの一般化不能性を是正すること。
- 点群やメッシュなどの離散的3D構造ではなく、連続的で微分可能な3D表現にコンセプトをグラウンディングすることで、より人間らしい3D視覚的推論を実現すること。
- 事前に定義されたセグメンテーションマスクを必要とせず、質問応答の監視から3Dセマンティックおよびインスタンスセグメンテーションが自然に出現するフレームワークの構築。
- 神経場に定義された神経演算子(フィルタリング、クエリ、カウント)を設計し、強力な視覚的推論とコンセプトグラウンディングを可能にすること。
提案手法
- フレームワークは、シーン内の各3D座標を高次元連続記述子ベクトルとして表現する神経記述子場(NDFs)を用いる。
- コンセプトグラウンディングは、3D座標の記述子と言語コンセプトの埋め込みベクトルとの間の微分可能なベクトル類似度により実行される。
- NDFs上に、存在検出用のフィルタ演算子、属性推論用のクエリ演算子、インスタンス数の定量化用の神経カウント演算子を定義する。
- 質問応答の監視を用いたエンドツーエンドで微分可能な訓練により、セグメンテーションと推論を統合最適化する。
- アノテートされた2Dマスクや事前に定義されたコンセプトカテゴリに依存せずに、自己教師ありの方法で3D表現を学習する。
- 神経場の連続性と微分可能性を活用することで、未学習の形状カテゴリや実スキャンに対してもゼロショット一般化を実現する。
実験結果
リサーチクエスチョン
- RQ1微分可能で連続的な3D表現を用いることで、セグメンテーションと推論の両方を統合的に学習可能な3Dコンセプトグラウンディングが達成可能か?
- RQ2微分可能で連続的な3D表現を用いることで、微調整なしに未学習の形状カテゴリや実世界スキャンに対し、どの程度一般化できるか?
- RQ3マスクの明示的監視なしに、質問応答の監視から3Dセマンティックおよびインスタンスレベルのセグメンテーションが自然に出現するか?
- RQ42Dセグメンテーションベースの手法と比較して、神経記述子場へのグラウンディングは、遮蔽に対するどの程度の耐性向上をもたらすか?
- RQ5フィルタリング、クエリ、カウントといった神経演算子が、神経場上で効果的に定義・学習可能であり、エンドツーエンドの視覚的推論を可能にするか?
主な発見
- ベンチマーク上、3D-CGは平均セマンティックセグメンテーションIoU 69.4を達成し、CVX(61.7)、CVX+L(65.2)、BAE(58.6)、BAE+L(61.3)といったベースラインモデルを大きく上回った。
- インスタンスセグメンテーションにおいては、平均IoU 56.9を達成し、BAE+L(42.0)やCVX+L(38.9)をすべて上回った。
- 未学習のカテゴリに対しても効果的な一般化が実現された:トレーニングにカートを用いた場合、自転車のホイールを正しく特定・数え、ベッドの脚をすべて検出できた。
- RedWoodデータセットの実スキャンにおいて、部分的で単一視点のスキャンでも、3D-CGは物体を正しくセグメンテーションし、推論を実行でき、実世界のデータ品質の低さに対しても頑健であることが示された。
- 実世界のシーンへのゼロショット転送が可能であり、トレーニングデータにそのような形状が含まれていなくても、ホイールや脚といった部品を正確に検出できた。
- QAの監視のみから3Dセグメンテーションが出現したことは、本手法が明示的なセグメンテーション監視なしに意味的かつ分離可能な3D表現を学習していることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。