[논문 리뷰] Bottom Up Top Down Detection Transformers for Language Grounding in Images and Point Clouds
이 논문은 사전에 훈련된 검출기로부터 얻은 언어, 시각적 특징, 객체 제안을 동시에 고려하여 2D 이미지와 3D 포인트 클라우드에서 언어적 참조 표현을 지도하는 새로운 비전-언어 모델인 BUTD-DETR를 제안한다. 검출기의 누락에 제약을 받지 않도록 설계되었으며, 검출 프롬프트, 박스 제안 주의, 향상된 정렬 손실을 활용하여 3D 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다. SR3D에서 12.6% 향상, NR3D에서 11.6%, ScanRefer에서 6.3% 향상되었으며, MDETR보다 50% 빠른 훈련 속도를 유지하면서도 2D 성능도 경쟁력 있다.
Most models tasked to ground referential utterances in 2D and 3D scenes learn to select the referred object from a pool of object proposals provided by a pre-trained detector. This is limiting because an utterance may refer to visual entities at various levels of granularity, such as the chair, the leg of the chair, or the tip of the front leg of the chair, which may be missed by the detector. We propose a language grounding model that attends on the referential utterance and on the object proposal pool computed from a pre-trained detector to decode referenced objects with a detection head, without selecting them from the pool. In this way, it is helped by powerful pre-trained object detectors without being restricted by their misses. We call our model Bottom Up Top Down DEtection TRansformers (BUTD-DETR) because it uses both language guidance (top down) and objectness guidance (bottom-up) to ground referential utterances in images and point clouds. Moreover, BUTD-DETR casts object detection as referential grounding and uses object labels as language prompts to be grounded in the visual scene, augmenting supervision for the referential grounding task in this way. The proposed model sets a new state-of-the-art across popular 3D language grounding benchmarks with significant performance gains over previous 3D approaches (12.6% on SR3D, 11.6% on NR3D and 6.3% on ScanRefer). When applied in 2D images, it performs on par with the previous state of the art. We ablate the design choices of our model and quantify their contribution to performance. Our code and checkpoints can be found at the project website https://butd-detr.github.io.
연구 동기 및 목표
- 기존 언어 지도 모델이 사전에 검출된 객체 제안에 의존하는 한계를 해결하기 위해, 미세한 또는 드문 객체를 놓칠 수 있는 제안을 피하기 위함.
- 작은, 가림당하거나 드문 객체에서 검출기가 자주 실패하는 3D 환경에서도 강력한 지도를 가능하게 하기 위함.
- 하나의 하부-업 객체 제안과 상부-다운 언어 가이던스를 통합하여 2D 및 3D 양쪽에서 성능을 향상시키기 위함.
- 오라클 박스 애너테이션에 의존도를 줄이기 위해, 검출 프롬프트를 지도로 사용하여 엔드 투 엔드로 훈련하기 위함.
- 다중 스트림 주의를 통한 조절된 검출이 2D에서 3D 시각 입력으로 효과적으로 일반화되는지 입증하기 위함.
제안 방법
- 모델은 언어 입력, 시각적 특징, 사전에 훈련된 검출기로부터 온 객체 제안을 동시에 고려하는 다중 스트림 트랜스포머 인코더-디코더 아키텍처를 사용한다.
- 객체 카테고리 레이블을 언어 프롬프트로 사용하여 시각적 장면에서 지도를 내기 위한 검출 프롬프트 지도 신호를 도입한다.
- 사전에 정의된 제안 풀에서 선택하는 대신, 직접 박스를 예측하는 검출 헤드를 사용하여 박스-버티고 문제를 피한다.
- 지도 지도의 노이즈를 줄이기 위해 향상된 경계상자-단어 스트림 정렬 손실을 적용한다.
- 계산 비용을 줄이기 위해 시각 스트림에서 변형 가능 주의를 사용하여 MDETR보다 더 빠른 훈련을 가능하게 한다.
- 대규모 이미지-언어 데이터셋에서 검출 프롬프트를 사용해 사전 훈련하고, 참조 지도 벤치마크에서 미세조정한다.
실험 결과
연구 질문
- RQ1사전에 훈련된 검출기로부터 온 언어와 객체 제안을 동시에 고려하는 지도 모델이 3D 언어 지도에서 제안-버티고 문제를 겪는 모델보다 성능이 뛰어나게 되는가?
- RQ2검출 프롬프트를 지도로 통합할 경우 3D 및 2D에서 지도 성능이 어떻게 향상되는가?
- RQ3객체 제안에 대한 주의가 작은, 가림당하거나 드문 객체의 국소화에 얼마나 기여하는가?
- RQ4MDETR의 설계가 적절한 시각 인코더 및 디코더 수정을 통해 3D 포인트 클라우드로 효과적으로 확장될 수 있는가?
- RQ5검출 프롬프트, 박스 스트림 주의, 향상된 정렬 손실이 전체 성능에 기여하는 상대적 기여도는 얼마인가?
주요 결과
- BUTD-DETR는 이전의 3D 방법보다 SR3D 벤치마크에서 평균 리콜 12.6% 향상하였다.
- NR3D 벤치마크에서는 11.6%의 절대적 향상을 기록하여 이전 방법들을 크게 앞서 갔다.
- ScanRefer 벤치마크에서는 이전 방법보다 6.3% 향상되어 강력한 일반화 능력을 입증했다.
- 2D에서는 RefCOCO, RefCOCO+, Flickr30k에서 경쟁력 있는 성능을 달성했으며, MDETR와 유사한 성능을 내면서도 GPU 훈련 시간의 50% 미만으로 수행되었다.
- 제거 실험 결과, 검출 프롬프트가 2.4%의 정확도 향상 기여, 박스 스트림 주의가 3.1%, 대비 손실 설계가 추가로 2.1%의 정확도 향상 기여를 하였다.
- 박스 제안이나 검출 프롬프트 없이도 직접 MDETR-3D를 구현한 것보다 유의미하게 뛰어난 성능을 보였으며, 제안된 구성 요소의 효과성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.