[論文レビュー] CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
CoT3DRefは、最終的なターゲットの予測の前に中間的なアンカーオブジェクトを予測する論理的推論ステップの連鎖として物体位置特定を分解することで、人間の認知を模倣するデータ効率的で解釈可能な3次元視覚的グランドイングフレームワークを提案する。このフレームワークはNr3D、Sr3D、ScanReferベンチマークで最先端の性能を達成し、訓練データの10%のみでSOTA結果を再現し、手動アノテーションの必要性を排除する効率的な疑似ラベル生成器を備えている。
3D visual grounding is the ability to localize objects in 3D scenes conditioned by utterances. Most existing methods devote the referring head to localize the referred object directly, causing failure in complex scenarios. In addition, it does not illustrate how and why the network reaches the final decision. In this paper, we address this question Can we design an interpretable 3D visual grounding framework that has the potential to mimic the human perception system?. To this end, we formulate the 3D visual grounding problem as a sequence-to-sequence Seq2Seq task by first predicting a chain of anchors and then the final target. Interpretability not only improves the overall performance but also helps us identify failure cases. Following the chain of thoughts approach enables us to decompose the referring task into interpretable intermediate steps, boosting the performance and making our framework extremely data-efficient. Moreover, our proposed framework can be easily integrated into any existing architecture. We validate our approach through comprehensive experiments on the Nr3D, Sr3D, and Scanrefer benchmarks and show consistent performance gains compared to existing methods without requiring manually annotated data. Furthermore, our proposed framework, dubbed CoT3DRef, is significantly data-efficient, whereas on the Sr3D dataset, when trained only on 10% of the data, we match the SOTA performance that trained on the entire data. The code is available at https:eslambakr.github.io/cot3dref.github.io/.
研究の動機と目的
- 人間の認知を模倣する解釈可能な3次元視覚的グランドイングフレームワークを設計し、推論を論理的ステップの連鎖としてモデル化すること。
- 大規模な手動アノテーションデータセットへの依存を減らすことで、3次元視覚的グランドイングにおけるデータ効率を向上させること。
- 最終的なターゲット位置特定の前に追跡可能な中間予測(アンカー)を可能にすることで、モデルの透明性を高めること。
- アーキテクチャの大幅な見直しを伴わずに、既存の3次元視覚的グランドイングアーキテクチャにシームレスに統合できること。
- 論理的オブジェクト順序に基づく疑似ラベル生成器を開発し、低コストで高品質な監視信号を提供することで、学習効率を向上させること。
提案手法
- 3次元視覚的グランドイングを、最終的なターゲットオブジェクトの前に中間アンカーの系列を予測する一連の順序処理(Seq2Seq)タスクとして定式化する。
- 自然言語クエリに言及されるオブジェクトの論理的順序を抽出するために、文脈に応じたプロンプトを適切に設計した大規模言語モデル(GPT-3.5)を用いる。
- 抽出された論理的順序を活用して、視覚的グランドイングモデルの学習に適した合成トレーニング信号を生成する疑似ラベル生成器を設計する。
- LAR、SAT、MVT、ViLの4つの既存アーキテクチャにCoT3DRefフレームワークを統合し、プラグアンドプレイ互換性を実現する。
- 生成された疑似ラベルを用いて、アンカー列と最終的なターゲット位置特定の両方の監視のもとで、モデルをエンドツーエンドに訓練する。
- 10%のNr3Dデータセットに対して幾何モジュールの正確性を検証するため、高品質なグランドトゥルースアノテーションを収集するためにウェブベースのインタラクティブインターフェースを採用する。
実験結果
リサーチクエスチョン
- RQ1人間の認知を模倣するように、中間的な論理的ステップを経て推論する3次元視覚的グランドイングモデルを設計できるか?
- RQ2手動アノテーションを追加で必要とせずに、チェーン・オブ・スコーズ(CoT)アプローチが3次元視覚的グランドイングにおけるデータ効率を向上させられるか?
- RQ3中間予測の解釈可能性がモデル性能や失敗事例の分析にどのように影響するか?
- RQ4論理的オブジェクト順序に基づく疑似ラベル生成器は、学習効率と一般化性能をどの程度向上させられるか?
- RQ5CoT3DRefフレームワークは、10%のデータでの学習でも複数のベンチマークでSOTA性能を達成できるか?
主な発見
- CoT3DRefは、追加の手動アノテーションを一切必要とせず、Sr3D、Nr3D、ScanReferベンチマークで最先端の性能を達成した。
- Sr3Dデータセットでは、CoT3DRefが訓練データの10%でのみ学習した場合でも、全データで学習したSOTAモデルと同等の性能を達成した。
- LAR、SAT、MVT、ViLベースラインに統合した場合、Nr3Dでは3.6%、4%、5%、0.5%の性能向上が見られ、Sr3Dでは10%、11%、9%、1%の向上が確認された。
- 疑似ラベル生成器は学習効率を顕著に向上させ、高価な人手によるアノテーションデータへの依存を減らしながらも、高い正確性を維持した。
- モデルの解釈可能性により、最終予測に至るまでの推論経路がアンカーの連鎖として可視化され、失敗事例の分析がより効果的に行えるようになった。
- ウェブベースのアノテーションインターフェースは、Nr3Dデータセットの10%分のグランドトゥルースデータを効果的に収集でき、幾何モジュールの正確性とアンカーの論理的順序の妥当性を検証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。