[논문 리뷰] M3DBench: Let's Instruct Large Models with Multi-modal 3D Prompts
M3DBench는 320,000개 이상의 지시-응답 쌍을 포함하는 대규모 다중모달 3D 지시 따르기 데이터셋을 소개하며, 텍스트, 이미지, 3D 객체, 좌표, 시각적 프롬프트를 통합하여 3D 중심 작업을 위한 다중모달 언어모델(MLM)의 지시 튜닝을 가능하게 한다. 이 벤치마크는 M3DBench로 미세조정된 모델이 시각적 인식, 추론, 탐색, 계획 등 다양한 3D 작업에서 뛰어난 성능을 발휘함을 보여주며, Vicuna-7B-v1.5 기반 모델이 세밀한 시나리오 기술 및 다중작업 평가에서 뛰어난 성능을 보였다.
Recently, 3D understanding has become popular to facilitate autonomous agents to perform further decisionmaking. However, existing 3D datasets and methods are often limited to specific tasks. On the other hand, recent progress in Large Language Models (LLMs) and Multimodal Language Models (MLMs) have demonstrated exceptional general language and imagery tasking performance. Therefore, it is interesting to unlock MLM's potential to be 3D generalist for wider tasks. However, current MLMs' research has been less focused on 3D tasks due to a lack of large-scale 3D instruction-following datasets. In this work, we introduce a comprehensive 3D instructionfollowing dataset called M3DBench, which possesses the following characteristics: 1) It supports general multimodal instructions interleaved with text, images, 3D objects, and other visual prompts. 2) It unifies diverse 3D tasks at both region and scene levels, covering a variety of fundamental abilities in real-world 3D environments. 3) It is a large-scale 3D instruction-following dataset with over 320k instruction-response pairs. Furthermore, we establish a new benchmark for assessing the performance of large models in understanding multi-modal 3D prompts. Extensive experiments demonstrate the effectiveness of our dataset and baseline, supporting general 3D-centric tasks, which can inspire future research.
연구 동기 및 목표
- 일반적인 3D 인식 다중모달 언어모델(MLM)을 훈련하기 위해 다중모달 입력을 지원하는 대규모이고 다양한 3D 지시 따르기 데이터셋의 부족을 해결하기 위해.
- 일관된 평가를 위해 시각적 인식, 추론, 탐색, 계획을 포함한 광범위한 3D 중심 작업을 하나의 벤치마크에서 통합하고 표준화하기 위해.
- 텍스트, 3D 객체, 이미지, 공간 좌표를 결합한 종합적이고 번갈아가며 적용되는 다중모달 프롬프팅 체계를 제공함으로써 대규모 모델의 3D 이해를 위한 지시 튜닝을 가능하게 하기 위해.
- 다양한 작업에서의 공정하고 재현 가능한 3D MLM 성능 평가를 가능하게 하는 기준 모델과 평가 프로토콜을 수립하기 위해.
제안 방법
- 텍스트, 2D 이미지, 3D 포인트 클라우드, 경계 상자, 좌표 기반 프롬프트를 혼합하여 다양한 3D 시각 작업을 표현하는 다중모달 지시 따르기 데이터셋을 설계하기 위해.
- 밀도 있는 기술, 시각적 질의 응답, 몸체 질의 응답, 다중 영역 추론, 몸체 계획 등 10개의 다양한 3D 작업에서 320,000개 이상의 지시-응답 쌍을 수집하고 주석 처리하기 위해.
- 언어 지시어와 다중 시각 모달리티(텍스트, 2D 이미지, 3D 객체, 공간 좌표)를 결합한 새로운 프롬프팅 체계를 도입하여 풍부하고 맥락 인식이 가능한 모델 상호작용을 가능하게 하기 위해.
- Adam 옵timizer와 코스인 학습률 감소를 사용하는 통합 훈련 파이프라인을 통해 LLM을 M3DBench 데이터셋에 대해 미세조정하고, 다양한 3D 인코더(예: PointNet++, Transformer)를 활용하여 모델을 훈련 및 평가하기 위해.
- 표준 NLP 메트릭(BLEU, ROUGE, METEOR, CiDEr)과 GPT-4 기반 비교 평가 점수를 사용하여 모델 성능을 평가하기 위해.
- 다섯 가지 핵심 작업으로 구성된 종합적인 평가 벤치마크를 수립하기 위해: 밀도 있는 기술, 시각적 질의 응답, 몸체 질의 응답, 다중 영역 추론, 몸체 계획.
실험 결과
연구 질문
- RQ1대규모 다중모달 3D 지시 따르기 데이터셋은 다양한 3D 비전 작업에서 다중모달 언어모델의 일반화 능력을 향상시키는가?
- RQ2제안된 번갈아가는 다중모달 프롬프팅 체계(텍스트, 이미지, 3D 객체, 좌표)는 3D 환경에서 정확하고 맥락 인식이 가능한 지시 따르기 능력을 향상시키는가?
- RQ3M3DBench로 미세조정된 최첨단 LLM과 기존 3D 벤치마크 또는 제로샷 능력에서의 성능 격차는 어느 정도인가?
- RQ4공간 추론 및 몸체 계획과 같은 다양한 3D 중심 작업에서 최고의 성능을 내는 모델 아키텍처 구성 요소(예: 3D 인코더, 언어 디코더)는 무엇인가?
- RQ5GPT-4 기반 평가는 복잡한 3D 시나리오에서 모델이 생성한 기술의 품질을 신뢰성 있게 평가할 수 있는가?
주요 결과
- Vicuna-7B-v1.5 기반 모델은 세밀한 기술 작업에서 GPT-4 점수 32.37을 기록하여 다른 LLM을 압도하며 강력한 3D 이해 능력을 보였다.
- Transformer 기반 3D 인코더를 사용한 모델가 PointNet++ 기반 모델보다 밀도 있는 기술 및 몸체 계획 작업에서 더 높은 성능을 보이며 아키텍처의 영향력이 있음을 시사했다.
- M3DBench로 훈련된 기준 모델은 여러 작업에서 최첨단 성능을 기록하였으며, 시각적 질의 응답에서 BLEU-4 점수 27.89, 다중 영역 추론에서 CiDEr 점수 29.08를 기록하였다.
- 모든 OPT-6.7B 디코더 기반 모델이 모든 작업에서 상대적으로 낮은 성능을 보이며, 모델 아키텍처와 사전학습 데이터가 3D 지시 따르기 능력에 큰 영향을 미친다는 것을 시사했다.
- M3DBench 벤치마크는 현재 모델들이 세밀한 시나리오 기술 및 다중 라운드 대화와 같은 복잡한 3D 작업에서 어려움을 겪고 있음을 드러내며, 3D 인식 지시 튜닝의 향상 여지가 있음을 보여주었다.
- 제안된 다중모달 프롬프팅 체계는 다양한 3D 작업을 효과적으로 지원하며, 모델들이 공간 좌표, 3D 객체 인스턴스, 이미지 참조를 포함한 지시어를 성공적으로 해석하고 응답함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.