Skip to main content
QUICK REVIEW

[논문 리뷰] HuBo-VLM: Unified Vision-Language Model designed for HUman roBOt interaction tasks

Zichao Dong, Weikun Zhang|arXiv (Cornell University)|2023. 08. 24.
Multimodal Machine Learning ApplicationsComputer Science인용 수 3
한 줄 요약

HuBo-VLM는 트랜스포머 기반 아키텍처를 사용하여 다양한 작업—예를 들어 시각적 기준 지정과 물체 검출—을 일련의 생성 문제로 간주하는 통합 시각-언어 모델을 제안한다. 공통의 인코더-디코더 트랜스포머를 사용하고 지시어 조정 및 다양한 다중모odal 데이터셋에서의 사전학습을 통해 Talk2Car 벤치마크에서 최고 성능(AP50: 76.74)을 달성하며, 작업별 특화 헤드 없이도 강력한 일반화 능력과 종단 간 기능을 보여준다.

ABSTRACT

Human robot interaction is an exciting task, which aimed to guide robots following instructions from human. Since huge gap lies between human natural language and machine codes, end to end human robot interaction models is fair challenging. Further, visual information receiving from sensors of robot is also a hard language for robot to perceive. In this work, HuBo-VLM is proposed to tackle perception tasks associated with human robot interaction including object detection and visual grounding by a unified transformer based vision language model. Extensive experiments on the Talk2Car benchmark demonstrate the effectiveness of our approach. Code would be publicly available in https://github.com/dzcgaara/HuBo-VLM.

연구 동기 및 목표

  • 종단 간 인간-로봇 상호작용을 해결하기 위해 인지 작업들을 단일 시각-언어 모델 아래 통합함으로써 도전 과제를 해결한다.
  • 영역 제안에 의존하거나 작업 일반화 능력 부족 등의 기존 VLM의 한계를 극복하기 위해 통합된 일련의 생성 프레임워크를 사용한다.
  • 대규모 언어 모델을 피하고 경량이며 효율적인 트랜스포머 아키텍처를 사용함으로써 로봇 하드웨어에 효율적으로 구현할 수 있도록 한다.
  • 지시 기반 프롬프팅과 미세조정을 통해 다양한 인간-로봇 상호작용 작업에서 제로샷 및 패기샷 적응을 지원한다.

제안 방법

  • 로봇 센서에서 온 원시 RGB 이미지를 처리하는 데 사용되는 시각 인코더(ResNet152)와 자연어 지시어를 처리하는 BERT 기반 언어 인코더가 사용된다.
  • 통합 트랜스포머 디코더가 공통 작업 해결자로 작동하여 바운딩 박스나 세그멘테이션 마스크와 같은 출력에 해당하는 텍스트 시퀀스를 생성한다.
  • 공통의 시각-언어 표현을 학습하기 위해 COCO, VQAv2, RefCOCO, ImageNet 등 총 15종의 다양한 다중모달 데이터셋 혼합체로 사전학습된다.
  • 과적합을 방지하기 위해 각 작업당 약 1,000개의 애너테이션 예제만을 사용하여 작업별 특화 미세조정이 수행된다.
  • 작업들은 모두 텍스트 생성으로 통합된다. 예를 들어, 시각적 기준 지정의 출력은 "(x0, y0, x1, y1)"와 같은 시퀀스로 이루어지며, 후처리를 통해 바운딩 박스로 변환된다.
  • 지시어 인코더를 통해 아키텍처 변경 없이도 작업 간 제로샷 및 패기샷 일반화가 가능해진다.

실험 결과

연구 질문

  • RQ1작업별 특화 구성 요소 없이도 다양한 인간-로봇 상호작용 작업에서 뛰어난 성능을 달성할 수 있는 통합 시각-언어 모델이 가능한가?
  • RQ2지시어 조정이 로봇 분야의 새로운 인지 작업에 대해 패기샷 적응을 얼마나 효과적으로 가능하게 하는가?
  • RQ3실제 로봇 환경 제약 조건 하에서, 더 복잡한 모델들인 MDETR나 Deformable DETR에 비해 경량 BERT 기반 디코더가 시각적 기준 지정에서 뛰어난 성능을 보일 수 있는가?
  • RQ4단일 사전학습 모델이 얼마나 다양한 시각-언어 벤치마크와 후행 작업에 일반화할 수 있는가?

주요 결과

  • HuBo-VLM는 Talk2Car 벤치마크에서 AP50 점수 76.74를 기록하며, Deformable-MDETR(74.4)와 Stacked VL-BERT(71)를 포함한 비교 모델 전부를 앞서며 최고 성능을 달성한다.
  • 모델는 패기샷 일반화 능력이 뛰어나 각 작업당 약 1,000개의 미세조정 예제만으로도 높은 성능을 달성한다.
  • 정성적 결과 분석에서 HuBo-VLM는 혼잡한 환경에서도 복잡한 자연어 지시어를 특정 물체에 정확하게 기준 지정할 수 있음을 보여주며, 이는 추론 능력을 시사한다.
  • 통합된 일련의 생성 접근 방식은 앵커 박스나 회귀 헤드와 같은 작업별 특화 헤드가 필요 없게 하여 배포 및 확장성 향상에 기여한다.
  • 모델는 높은 효율성을 유지하며, 대규모 언어 모델 대신 작은 BERT 기반 디코더를 사용함으로써 임베디드 로봇 시스템에 적합하다.
  • 15개의 다양한 데이터셋 혼합체로 사전학습을 수행함으로써 기준 지정, 캡션 생성, VQA 등 다양한 작업에서 강력한 제로샷 및 패기샷 전이 성능을 달성할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.