[論文レビュー] Toward Explainable and Fine-Grained 3D Grounding through Referring Textual Phrases
本稿では、自然言語記述に言及されたターゲットオブジェクトおよび非ターゲットオブジェクトの両方を局所化する、細分化された3次元視覚的局所化タスク「3Dフレーズ・アウェア・グラウンディング(3DPAG)」を導入する。フレーズ-オブジェクトアライメント最適化とフレーズ固有の事前学習を提案し、約227Kのフレーズレベルのアノテーションを含む新しいデータセットを公開することで、標準ベンチマーク上での最先端の3DVG性能が3.9%〜4.6%向上した。
Recent progress in 3D scene understanding has explored visual grounding (3DVG) to localize a target object through a language description. However, existing methods only consider the dependency between the entire sentence and the target object, ignoring fine-grained relationships between contexts and non-target ones. In this paper, we extend 3DVG to a more fine-grained and interpretable task, called 3D Phrase Aware Grounding (3DPAG). The 3DPAG task aims to localize the target objects in a 3D scene by explicitly identifying all phrase-related objects and then conducting the reasoning according to contextual phrases. To tackle this problem, we manually labeled about 227K phrase-level annotations using a self-developed platform, from 88K sentences of widely used 3DVG datasets, i.e., Nr3D, Sr3D and ScanRefer. By tapping on our datasets, we can extend previous 3DVG methods to the fine-grained phrase-aware scenario. It is achieved through the proposed novel phrase-object alignment optimization and phrase-specific pre-training, boosting conventional 3DVG performance as well. Extensive results confirm significant improvements, i.e., previous state-of-the-art method achieves 3.9%, 3.5% and 4.6% overall accuracy gains on Nr3D, Sr3D and ScanRefer respectively.
研究の動機と目的
- 既存の3次元視覚的局所化(3DVG)手法がターゲットオブジェクトにのみ注目しており、非ターゲットオブジェクトとの細分化された関係を無視するという制限に対処する。
- 3次元シーン内のすべてのフレーズで参照されたオブジェクトを明示的に局所化することで、より解釈可能で説明可能な3D局所化を実現する。
- Nr3D、Sr3D、ScanReferから88Kの文に約227Kの手動でアノテートされたフレーズレベルの参照を追加し、新しいベンチマークを構築する。
- 即挿入可能な技術として、フレーズ-オブジェクトアライメント最適化とフレーズ固有の事前学習を提案し、既存の3DVGモデルが3DPAGタスクを実行できるように強化する。
- 3DPAGが複数の標準データセット上で3DVG性能を顕著に向上させることを実証する。
提案手法
- 既存の3DVGデータセット(Nr3D、Sr3D、ScanRefer)から88Kの文を抽出し、約227Kのフレーズレベルの参照をアノテートすることで、3つの新しいデータセット(Sr3D++、Nr3D++、ScanRefer++)を構築する。
- 言語フレーズと対応する3次元オブジェクトをよりよくアライメントするため、クロスアテンション特徴を最適化する新しいフレーズ-オブジェクトアライメント(POA)マップ最適化技術を導入する。
- 訓練中にターゲットオブジェクトを他のフレーズで参照されたオブジェクトに交互に入れ替えるために、合成マスクを用いたフレーズ固有の事前学習戦略を設計する。
- POA最適化とフレーズ固有の事前学習を統合することで、既存の3DVGモデル(例:SAT、MVT)を変更し、3DPAGを実行可能にする。
- ルールベースのフレーズ検出と訓練時にターゲットオブジェクトのアノテーションのみを用いる弱教師付き3DPAGを実装し、評価は完全なフレーズアノテーションを対象とする。
- 標準的な指標($Acc_{ ext{VG}}$ および $Acc_{ ext{PG}}$)を用いて、3DVGおよび3DPAGの両タスクの性能を評価する。
実験結果
リサーチクエスチョン
- RQ1ターゲットオブジェクトに限らず、すべてのフレーズで参照されたオブジェクトを局所化する細分化された3次元視覚的局所化は、より正確で解釈可能な3次元シーン理解をもたらすか?
- RQ2フレーズ固有の事前学習は、3次元局所化における非ターゲットオブジェクトへのモデル一般化をどの程度向上させるか?
- RQ3フレーズ-オブジェクトアライメントマップの最適化は、複雑な3次元シーンにおける局所化精度をどの程度向上させるか?
- RQ4既存の3DVGアノテーションからの弱教師付き情報のみを用いて、既存の3DVGモデルを3DPAGタスクに効果的に適応できるか?
- RQ5フレーズ-オブジェクト関係の明示的モデリングは、標準的な3DVGベンチマークで測定可能な性能向上をもたらすか?
主な発見
- 提案された3DPAGタスクは3DVG性能を顕著に向上させ、SOTA手法MVTがNr3Dで59.0%の精度を達成し、ベースラインから3.9%向上した。
- Sr3Dでは同じ手法が68.0%の精度を達成し、前回SOTAより3.5%向上し、ScanReferでは59.9%の精度を記録し、4.6%の向上を達成した。
- アブレーションスタディにより、フレーズ固有の事前学習とPOA最適化の両方が性能向上に寄与することが確認され、SATとMVTの両方でベースラインからそれぞれ5.2%および3.9%の向上を示した。
- 弱教師付き3DPAG設定(訓練時にターゲットオブジェクトのアノテーションのみ)でも、意味のある性能(例:ScanRefer++で43.6%)を達成しており、提案手法のコンponentsの堅牢性を示している。
- BUTD-DETRモデルに提案手法を適用したところ、ScanRefer++で$Acc_{PG}@0.5$が22.6%から32.3%に向上し、明示的なフレーズ-オブジェクト監視の必要性を確認した。
- 可視化結果から、3DPAGはフレーズごとに色分けされた細分化された予測を生成し、モデル意思決定の内在的解釈可能性と説明可能性を提供していることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。