Skip to main content
QUICK REVIEW

[논문 리뷰] Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers

Haifeng Huang, Chen, Yilun|arXiv (Cornell University)|2023. 12. 13.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)이 3D 환경에서 다수의 객체를 정확히 참조하고 추론할 수 있도록 객체 식별자를 사용하는 이단계 보정 방법인 Chat-3D v2를 제안한다. 각 객체에 대해 특성 인식 및 관계 인식 토큰을 학습함으로써 모델은 강력한 3D-LLM 보정을 구축하여, 참조 정확도 향상과 함께 지도 학습 및 캡션 생성 작업에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Recent advancements in 3D Large Language Models (LLMs) have demonstrated promising capabilities for 3D scene understanding. However, previous methods exhibit deficiencies in general referencing and grounding capabilities for intricate scene comprehension. In this paper, we introduce the use of object identifiers and object-centric representations to interact with scenes at the object level. Specifically, we decompose the input 3D scene into a set of object proposals, each assigned a unique identifier token, which enables efficient object referencing and grounding during user-assistant interactions. Given the scarcity of scene-language data, we model the scene embeddings as a sequence of explicit object-level embeddings, derived from semantic-rich 2D or 3D representations. By employing object identifiers, we transform diverse 3D scene-language tasks into a unified question-answering format, facilitating joint training without the need for additional task-specific heads. With minimal fine-tuning on all downstream tasks, our model significantly outperforms existing methods on benchmarks including ScanRefer, Multi3DRefer, Scan2Cap, ScanQA, and SQA3D.

연구 동기 및 목표

  • 다양한 객체 참조를 가능하게 하기 위해 3D 환경에서 객체 식별자를 도입하여 명확한 참조를 가능하게 하기 위해 대규모 언어 모델(LLMs)이 다중 객체 질의를 처리할 수 있도록 하는 것.
  • LLM의 임bedding 공간 내에서 3D 객체와 그 식별자 간에 신뢰할 수 있는 일대일 대응을 수립하는 과제를 해결하는 것.
  • 학습된 관계 인식 토큰을 통해 수십 개의 3D 객체 간의 복잡한 공간 관계를 LLM의 추론에 통합하는 것.
  • 식별자 기반 지시 튜닝을 활용하여 지도 학습된 데이터셋을 기반으로 3D 환경 이해 작업(예: 지도 학습, 캡션 생성, 시각적 질문 응답)의 성능을 향상시키는 것.
  • GPT-4를 활용하여 rich한 객체 식별자를 포함한 새로운 3D 환경 캡션 데이터셋을 구축하여 향상된 평가를 가능하게 하는 것.

제안 방법

  • 이중 단계 보정 프레임워크를 제안: 먼저 각 객체의 시각적 및 의미적 특징에 대해 특성 인식 토큰을 학습하고, 그 다음 이웃 객체들과의 공간 관계를 캡처하기 위해 관계 인식 토큰을 학습한다.
  • 신뢰할 수 있는 3D 인스턴스 세그멘테이션 모델을 통해 추출된 고유한 객체 식별자(예: obj13, obj23)를 각 3D 인스턴스에 할당하여 정확한 참조를 가능하게 한다.
  • 관계 모듈을 활용해 주변 객체의 공간 정보를 집계하고 이를 관계 인식 토큰에 통합함으로써 LLM 내의 공간 추론 능력을 향상시킨다.
  • 이중 단계 학습 전략을 적용: 먼저 객체 수준 보정을 통해 3D 특징을 LLM 임베딩 공간에 매핑하고, 그 다음 시나리오 수준 보정을 통해 토큰 표현을 정교화한다.
  • 객체 식별자를 입력 컨텍스트로 사용하여 지시 튜닝 데이터셋으로 모델을 미세조정함으로써 3D 환경 내에서의 다이얼로그에 대해 민첩하고 정확한 반응을 가능하게 한다.
  • 예측 확률 분포를 활용해 보조 기반 모델의 예측 결과를 필터링하고, 그 후 식별자 인식 모델을 프롬프팅하여 최종 답변을 선택함으로써 모델 앙상블을 가능하게 한다.
Figure 1 : An example of using object identifiers in the conversation.
Figure 1 : An example of using object identifiers in the conversation.

실험 결과

연구 질문

  • RQ1객체 식별자가 LLM과의 3D 환경 대화에서 객체 참조의 정밀도와 명확도를 크게 향상시킬 수 있는가?
  • RQ2LLM의 임베딩 공간 내에서 3D 객체와 그 식별자 간에 신뢰할 수 있는 일대일 대응을 어떻게 수립할 수 있는가?
  • RQ3학습된 관계 인식 토큰이 특성 인식 토큰만을 사용하는 것과 비교해 공간 추론 능력을 얼마나 향상시킬 수 있는가?
  • RQ4제안된 보정 방법이 기존의 3D-LLM 접근 방식보다 다중 객체 지도 학습 및 시나리오 캡션 생성 작업에서 우월한 성능을 보일 수 있는가?
  • RQ5고성능 보조 기반 모델과의 통합이 참조 정확도 향상에 얼마나 효과적인가?

주요 결과

  • 제안된 방법은 객체 식별자 지원이 없는 이전의 3D-LLM에 비해 Nr3D/Sr3D 지도 학습 벤치마크에서 최신 기술 수준의 성능을 달성하였다.
  • ScanRefer 및 Nr3D/Sr3D에서 모델는 보조 기반 모델과 경쟁 가능한 성능을 기록하였으며, 단순한 관계 모듈을 사용함에도 불구하고 강력한 시나리오 이해 및 추론 능력을 입증하였다.
  • 제거 실험 결과, 객체 식별자 자체만으로도 성능 향상이 뚜렷하게 나타나며, 특성 인식 및 관계 인식 토큰의 조합이 가장 우수한 성능을 낸다.
  • 학습된 관계 인식 토큰을 평균 풀링된 표현으로 대체할 경우 성능 저하가 뚜렷하게 발생함으로써, 관계 모듈이 공간적 구조를 포착하는 데 중요한 역할을 한다는 점을 입증한다.
  • ViL3DRel과의 앙상블을 통해 지도 학습 정확도가 약 1.0% 향상되었으며, 이는 식별자 인식 모델이 고신뢰도 후보 예측을 효과적으로 보완할 수 있음을 보여준다.
  • 3D 시나리오 캡션 생성에서 Chat-3D에 비해 더 포괄적이고 시나리오 중심의 기술을 생성함으로써, 모델은 고립된 시각적 요소에 과도하게 집중하는 경향을 보이지 않는다.
Figure 2 : Overall architecture of our model.
Figure 2 : Overall architecture of our model.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.