[논문 리뷰] 3D-VLA: A 3D Vision-Language-Action Generative World Model
3D-VLA는 3D로 추론하고 목표 이미지/포인트 클라우드를 생성하며 3D-LMM 백본과 상호작용 토큰을 통합하여 디퓨전 기반 목표 생성을 통해 조작을 위한 행동을 예측하는 3D 비전-언어-행동 구현 기반 모델이다.
Recent vision-language-action (VLA) models rely on 2D inputs, lacking integration with the broader realm of the 3D physical world. Furthermore, they perform action prediction by learning a direct mapping from perception to action, neglecting the vast dynamics of the world and the relations between actions and dynamics. In contrast, human beings are endowed with world models that depict imagination about future scenarios to plan actions accordingly. To this end, we propose 3D-VLA by introducing a new family of embodied foundation models that seamlessly link 3D perception, reasoning, and action through a generative world model. Specifically, 3D-VLA is built on top of a 3D-based large language model (LLM), and a set of interaction tokens is introduced to engage with the embodied environment. Furthermore, to inject generation abilities into the model, we train a series of embodied diffusion models and align them into the LLM for predicting the goal images and point clouds. To train our 3D-VLA, we curate a large-scale 3D embodied instruction dataset by extracting vast 3D-related information from existing robotics datasets. Our experiments on held-in datasets demonstrate that 3D-VLA significantly improves the reasoning, multimodal generation, and planning capabilities in embodied environments, showcasing its potential in real-world applications.
연구 동기 및 목표
- 2D 입력을 넘어 지각, 추론, 행동을 통합하는 3D 구현 세계 모델의 필요성을 제시한다.
- 3D 환경에서 추론하고 다중 모달 목표를 상상하며 행동을 계획할 수 있는 확장 가능한 3D 구현 기반 모델을 개발한다.
- 이러한 모델을 학습시키기 위한 대규모 3D 구현 지시 튜닝 데이터셋을 생성한다.
- LLM에 맞춰 정렬된 확산 기반 목표 생성을 통해 전용 토큰으로 3D 환경과의 상호작용을 가능하게 한다.
제안 방법
- 객체, 위치, 장면에 대한 전용 상호작용 토큰과 7-DoF 로봇 동작을 갖춘 3D-LLM 백본(3D-VLA)을 구축한다.
- RGB-D-to-RGB-D 및 point-to-point 확산 모델을 사전 학습시켜 목표 생성을 주입하고 이를 트랜스포머 프로젝터를 통해 LLM에 정렬한다.
- 로봇공학 및 인간-물체 데이터셋에서 3D 주석(depth, point clouds, 3D boxes, actions)을 추출하여 2M 3D-언어-행동 데이터셋을 큐레이션한다.
- 새 토큰 임베딩, 출력층, 프로젝터만 학습하는 동안 확산 모델을 미세조정하기 위해 LoRA를 사용한다.
- 추가 토큰(<image>, <pcd> 등)과 DM 특징을 LLM 임베딩으로 매핑하는 프로젝터를 사용하여 언어 모델과 확산 모델을 연결한다.
- 지시사항에 조건화된 3D 목표 출력(이미지, 깊이, 포인트 클라우드)을 도출하는 파이프라인을 학습하여 구현된 계획을 유도한다.
실험 결과
연구 질문
- RQ13D 지향 월드 모델이 구현 기반 추론, 위치 추정, 계획에서 2D 기준선보다 우수할 수 있는가?
- RQ2LLM에 정렬된 목표 생성 확산 모델이 구현형 작업의 다중 모달 출력(이미지, 깊이, 포인트 클라우드)을 얼마나 개선할 수 있는가?
- RQ33D 구현 지시 튜닝 데이터셋이 로봇 공학 환경에서 견고한 3D 위치 추정, 작업 캡션 생성, 행동 예측을 가능하게 하는가?
- RQ4상호작용 토큰과 3D 표현이 행동 계획 및 미지의 작업으로의 일반화에 어떤 영향을 미치는가?
- RQ5구현 작업에서 3D-VLA와 2D 비전-언어 모델의 비교 성능은 어떠한가?
주요 결과
- 3D-VLA는 구현 데이터셋 전반에서 추론 및 위치 추정 작업에서 2D 기준선보다 우수하다.
- 중간 예측 바운딩 박스의 도움으로 비-3D 또는 비정렬 기준선에 비해 RGB 및 포인트 클라우드 목표 생성을 능가한다.
- RLBench 및 CALVIN 벤치마크에서 강력한 행동 계획을 보여주며, 여러 작업에서 선택된 기준선 대비 유의한 개선이 있다.
- 3D 주석을 사용할 때 3D-VLA가 Kosmos-2 및 CoVLM 기준선을 상회한다.
- 데이터셋과 3D 토큰은 역동적인 장면과 조작 예측에서 강건한 상호작용을 가능하게 한다.
- 전용 3D 구현 지시 튜닝 데이터셋은 3D 추론, 목표 상상, 행동 실행을 가능하게 하는 데 효과적이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.