Skip to main content
QUICK REVIEW

[논문 리뷰] CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding

Eslam Mohamed Bakr, Mohamed Ayman|arXiv (Cornell University)|2023. 10. 10.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

CoT3DRef는 인간의 인지 방식을 모방하여 물체 위치를 특정하는 과정을 논리적 추론 단계의 연속으로 분해함으로써 데이터 효율성과 해석 가능성을 동시에 향상시킨 3D 시각적 기반 프레임워크를 제안한다. 이는 최종 대상 객체를 예측하기 이전에 중간 단계의 앵커를 예측하는 방식이다. CoT3DRef는 Nr3D, Sr3D, ScanRefer 벤치마크에서 최신 기술 수준(SoTA) 성능을 달성하며, 훈련 데이터의 10%만으로도 동등한 성능을 내고, 수동 애너테이션의 필요성을 제거하기 위해 효율적인 가짜 레이블 생성기를 도입한다.

ABSTRACT

3D visual grounding is the ability to localize objects in 3D scenes conditioned by utterances. Most existing methods devote the referring head to localize the referred object directly, causing failure in complex scenarios. In addition, it does not illustrate how and why the network reaches the final decision. In this paper, we address this question Can we design an interpretable 3D visual grounding framework that has the potential to mimic the human perception system?. To this end, we formulate the 3D visual grounding problem as a sequence-to-sequence Seq2Seq task by first predicting a chain of anchors and then the final target. Interpretability not only improves the overall performance but also helps us identify failure cases. Following the chain of thoughts approach enables us to decompose the referring task into interpretable intermediate steps, boosting the performance and making our framework extremely data-efficient. Moreover, our proposed framework can be easily integrated into any existing architecture. We validate our approach through comprehensive experiments on the Nr3D, Sr3D, and Scanrefer benchmarks and show consistent performance gains compared to existing methods without requiring manually annotated data. Furthermore, our proposed framework, dubbed CoT3DRef, is significantly data-efficient, whereas on the Sr3D dataset, when trained only on 10% of the data, we match the SOTA performance that trained on the entire data. The code is available at https:eslambakr.github.io/cot3dref.github.io/.

연구 동기 및 목표

  • 사람의 인지 방식을 모방하기 위해 추론 과정을 논리적 단계의 연속으로 모델링함으로써 해석 가능한 3D 시각적 기반 프레임워크를 설계한다.
  • 대규모 수동 애너테이션 데이터셋에 대한 의존도를 줄임으로써 3D 시각적 기반의 데이터 효율성을 향상시킨다.
  • 최종 대상 위치 결정 이전에 추적 가능한 중간 예측(앵커)을 가능하게 함으로써 모델의 투명성을 향상시킨다.
  • 기존 3D 시각적 기반 아키텍처에 대한 구조적 개편 없이도 원활하게 통합될 수 있도록 한다.
  • 논리적 객체 순서를 기반으로 한 가짜 레이블 생성기를 개발하여 저비용·고품질의 지도 신호를 제공함으로써 학습 효율성을 높인다.

제안 방법

  • 모델이 최종 대상 객체 이전에 중간 앵커의 인과적 연속을 예측하는 방식으로 3D 시각적 기반을 순서에서 순서로(Seq2Seq) 작업으로 설정한다.
  • 자연어 질의에서 언급된 객체의 논리적 순서를 추출하기 위해 정교하게 설계된 컨텍스트 프롬프트를 활용한 대규모 언어 모델(GPT-3.5)을 사용한다.
  • 추출된 논리적 순서를 활용해 시각적 기반 모델의 훈련을 위한 합성 훈련 신호를 생성하는 가짜 레이블 생성기를 설계한다.
  • LAR, SAT, MVT, ViL 등 네 가지 기존 아키텍처에 CoT3DRef 프레임워크를 통합하여 플러그 앤 플레이 호환성을 확보한다.
  • 생성된 가짜 레이블을 사용해 엔드 투 엔드로 모델을 훈련시키며, 앵커 시퀀스와 최종 대상 위치 결정에 모두 지도를 제공한다.
  • 10%의 Nr3D 데이터셋에 대해 기하 모듈의 정확도를 검증하기 위해 고품질의 지상 진실 애너테이션을 수집하기 위해 웹 기반 상호작용 인터페이스를 활용한다.

실험 결과

연구 질문

  • RQ1사람의 인지 방식을 모방하기 위해 중간 논리적 단계를 거쳐 추론하는 3D 시각적 기반 모델을 설계할 수 있는가?
  • RQ2사용자 수동 애너테이션 없이도 사전적 추론 접근이 3D 시각적 기반의 데이터 효율성을 향상시킬 수 있는가?
  • RQ3중간 예측의 해석 가능성은 모델 성능과 실패 케이스 분석에 어떤 영향을 미치는가?
  • RQ4논리적 객체 순서를 기반으로 한 가짜 레이블 생성기가 학습 효율성과 일반화 능력을 얼마나 향상시킬 수 있는가?
  • RQ5CoT3DRef 프레임워크는 훈련 데이터의 10%만으로도 여러 벤치마크에서 최신 기술 수준 성능을 달성할 수 있는가?

주요 결과

  • CoT3DRef는 추가적인 수동 애너테이션 없이도 Sr3D, Nr3D, ScanRefer 벤치마크에서 최신 기술 수준 성능을 달성한다.
  • Sr3D 데이터셋에서 CoT3DRef는 전체 데이터셋으로 훈련된 모델의 최신 기술 수준 성능을 10%의 훈련 데이터로도 재현한다.
  • LAR, SAT, MVT, ViL 기반 모델에 통합했을 때 각각 Nr3D에서 3.6%, 4%, 5%, 0.5% 향상되었으며, Sr3D에서는 10%, 11%, 9%, 1% 향상되었다.
  • 가짜 레이블 생성기가 학습 효율성을 크게 향상시켜 고비용 수동 애너테이션 데이터에 대한 의존도를 줄였으며, 높은 정확도를 유지한다.
  • 모델의 해석 가능성 덕분에 실패 케이스 분석이 향상되었으며, 최종 예측에 도달하기까지의 추론 경로를 앵커의 연속으로 확인할 수 있다.
  • 웹 기반 애너테이션 인터페이스는 Nr3D 데이터셋의 10%에 대해 지상 진실 데이터를 성공적으로 수집하여 기하 모듈의 정확성과 앵커의 논리적 순서 정확성을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.