Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging Large (Visual) Language Models for Robot 3D Scene Understanding

William Chen, Siyi Hu|arXiv (Cornell University)|2022. 09. 12.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 로봇의 3차원 환경 이해를 위해 대규모 사전 훈련된 시각-언어 모델(VLMs)과 언어 모델(LMs)을 활용하는 것을 제안한다. 특히 실내 공간 분류에 초점을 맞추며, 물체 레이블, 공간 정보, 언어 사전 지식을 조합함으로써 제로샷 프롬프팅 또는 미세조정된 구조적 프롬프팅을 통해 약 70%의 정확도를 달성한다. 이는 시각 전용 및 그래프 기반 방법을 능가하며, 예상치 못한 물체와 새로운 레이블 공간에 대한 강력한 일반화 및 전이 능력을 보여준다.

ABSTRACT

Abstract semantic 3D scene understanding is a problem of critical importance in robotics. As robots still lack the common-sense knowledge about household objects and locations of an average human, we investigate the use of pre-trained language models to impart common sense for scene understanding. We introduce and compare a wide range of scene classification paradigms that leverage language only (zero-shot, embedding-based, and structured-language) or vision and language (zero-shot and fine-tuned). We find that the best approaches in both categories yield $\sim 70\%$ room classification accuracy, exceeding the performance of pure-vision and graph classifiers. We also find such methods demonstrate notable generalization and transfer capabilities stemming from their use of language.

연구 동기 및 목표

  • 로봇의 의미론적 3차원 환경 이해 문제, 특히 실내 유형과 같은 고수준 공간 개념에 대해 해결책을 모색한다.
  • 사전 훈련된 언어 모델(LMs)과 시각-언어 모델(VLMs)이 로봇 환경 이해에 공통된 지식을 어떻게 제공할 수 있는지 탐구한다.
  • 3차원 환경 그래프에서 실내 분류를 위한 언어 전용 및 시각-언어 접근 방식을 비교한다.
  • 훈련 중에 볼 수 없었던 물체와 새로운 레이블 공간에 대한 일반화 및 전이 성능을 평가한다.
  • 이러한 모델이 자원 제약이 있는 로봇 플랫폼에 구현 가능한지 탐색한다.

제안 방법

  • 저자들은 GPT-J와 같은 사전 훈련된 언어 모델을 사용하여, 포함된 물체와 공간 구조(물체 레이블, 위치, 실내 치수 포함)의 텍스트 기반 기술을 바탕으로 실내를 분류한다.
  • 그들은 공간적 및 의미적 정보를 자연어 문자열로 인코딩하여 언어 모델(LMs)에 입력하기 위한 구조적 언어 프롬프팅 방법을 설계한다.
  • 시각-언어 접근 방식의 경우, CLIP, LLaVA와 같은 VLMs를 사용하여 시각적 특징과 텍스트 기술을 동시에 처리하여 실내 분류를 수행한다.
  • Matterport3D 데이터셋에서 제로샷 프롬프팅과 미세조정된 LM 및 VLM 변형 간의 성능을 비교한다.
  • 표준 정확도 지표를 사용하여 성능을 평가하고, 보류된 물체와 새로운 레이블 공간에 대한 제로샷 일반화를 분석한다.
  • 예측 결과를 시각화하고, 다양한 입력 구성 요소(예: 물체 레이블 대비 공간 구조)의 영향을 평가하기 위한 분석 연구를 수행한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 언어 모델이 로봇의 3차원 환경 이해, 특히 실내 분류에 효과적인 공통 지식 사전 지식을 제공할 수 있는가?
  • RQ2공간적 및 의미적 정보를 자연어로 인코딩하는 구조적 언어 프롬프팅 방식이 단순한 물체 레이블 전용 프롬프팅 대비 정확도와 일반화 능력에서 어떻게 다른가?
  • RQ3시각-언어 모델(VLMs)이 시각 전용 방법보다 실내 분류에서 더 나은 성능을 내는가? 그리고 시각적 신호와 언어적 신호를 통합할 경우 어떤 영향을 미치는가?
  • RQ4이러한 언어 기반 접근 방식이 훈련 중에 볼 수 없었던 물체와 새로운 레이블 공간에 얼마나 잘 일반화되는가?
  • RQ5모델 크기와 추론 제약 조건이 성능에 어떤 영향을 미치며, 더 작은 모델도 로봇 플랫폼에서 강력한 성능을 낼 수 있는가?

주요 결과

  • 언어 전용 및 시각-언어 접근 방식 중 가장 뛰어난 성능을 보인 방법들이 약 70%의 실내 분류 정확도를 달성했으며, 순수 시각 기반 및 그래프 기반 분류기들을 능가했다.
  • 물체의 위치와 실내 치수를 포함한 구조적 언어 접근 방식이 더 풍부한 공간적 맥락 덕분에 단순한 물체 레이블 전용 프롬프팅보다 유의미하게 뛰어난 성능을 보였다.
  • 시각-언어 모델(VLMs)은 시각적 특징과 텍스트 기술을 결합함으로써 시각 전용 방법보다 더 높은 성능을 달성했으며, 수동적인 특징 설계가 최소한이었다.
  • 모든 언어 기반 접근 방식이 예상치 못한 물체와 새로운 레이블 공간에 대해 강력한 제로샷 일반화 능력을 보였으며, 언어 사전 지식의 강건성을 입증했다.
  • 단일 RTX 3080 GPU로 제한된 계산 자원 조건에서도 GPT-J와 같은 더 작은 모델이 뛰어난 성능을 보였으며, 이는 모바일 로봇에의 구현 가능성을 시사한다.
  • 훈련 데이터의 편향(예: Matterport3D의 좁은 인구 통계적 표현)이 다양한 환경에서의 모델의 공정성과 일반화 능력에 영향을 줄 수 있음을 밝혀냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.