Skip to main content
QUICK REVIEW

[논문 리뷰] Reasoning Grasping via Multimodal Large Language Model

Shiyu Jin, Jinxuan Xu|arXiv (Cornell University)|2024. 02. 09.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 다중모달 대규모 언어모델(Multimodal LLM)을 시각 기반 잡기 프레임워크와 통합하여 암묵적인 구두 지시에서 정밀한 잡기 자세를 생성하는 새로운 작업인 추론 잡기(Reasoning Grasping)를 소개한다. 이 방법은 특수 토큰 식별과 텍스트 특징 투영을 통해 잡기 예측 성능을 향상시키며, 실제 환경 실험에서 25/40의 성공률을 기록하여 CLIP+GR-ConvNet 기준선(15/40)보다 뚜렷이 뛰어나다.

ABSTRACT

Despite significant progress in robotic systems for operation within human-centric environments, existing models still heavily rely on explicit human commands to identify and manipulate specific objects. This limits their effectiveness in environments where understanding and acting on implicit human intentions are crucial. In this study, we introduce a novel task: reasoning grasping, where robots need to generate grasp poses based on indirect verbal instructions or intentions. To accomplish this, we propose an end-to-end reasoning grasping model that integrates a multimodal Large Language Model (LLM) with a vision-based robotic grasping framework. In addition, we present the first reasoning grasping benchmark dataset generated from the GraspNet-1 billion, incorporating implicit instructions for object-level and part-level grasping. Our results show that directly integrating CLIP or LLaVA with the grasp detection model performs poorly on the challenging reasoning grasping tasks, while our proposed model demonstrates significantly enhanced performance both in the reasoning grasping benchmark and real-world experiments.

연구 동기 및 목표

  • 현재 로봇 잡기 시스템이 명시적 언어 명령에 의존하고 시각적 맥락 이해 능력이 부족한 점을 해결하기 위해.
  • 사람의 암묵적 의도(예: '물 마셔야 해')를 이해하고 자동으로 적절한 물체를 선택 및 잡을 수 있도록 하기 위해.
  • 암묵적 지시를 포함한 새로운 추론 잡기 벤치마크 데이터셋을 개발하여, 물체 수준 및 부품 수준의 잡기 애너테이션과 함께 약 1억 개의 잡기 자세를 포함시키기 위해.
  • 다중모달 LLM의 추론 능력을 활용해 시각 입력과 복잡한 지시를 직접 정밀한 잡기 자세로 매핑하는 종단간 모델을 설계하기 위해.
  • 다중모달 LLM을 잡기 탐지에 통합할 경우, CLIP나 LLaVA를 직접 통합하는 것보다 암묵적 지시 작업에서 성능 향상이 이루어지는지 입증하기 위해.

제안 방법

  • 모델은 다중모달 LLM(fine-tuned LLaVA)을 사용해 시각적 입력과 암묵적 언어 지시를 해석하고, 잡기 대상이 되는 물체를 식별하는 텍스트 출력을 생성한다.
  • LLM 출력 내 특수 토큰을 식별하여 가장 관련성이 높은 대상 물체 이름만 추출함으로써 문장의 부피를 줄이고 집중도를 향상시킨다.
  • 핵심 토큰에서 유도된 텍스트 임베딩은 학습 가능한 투영 네트워크를 통해 압축된 특징 표현으로 변환된다.
  • 이 텍스트 특징은 잡기 탐지 헤드에서 시각적 특징과 융합되어 더 정확한 잡기 자세 예측을 유도한다.
  • 프레임워크는 GraspNet-1Billion에서 유도된 새로운 추론 잡기 벤치마크 데이터셋을 기반으로 훈련 및 평가되며, 1730개의 암묵적 지시와 약 1억 개의 잡기 자세를 포함한다.
  • 실제 환경 실험은 Azure Kinect를 사용한 7-DoF Franka Panda 로봇을 활용하며, 실행을 위해 상위 3개 예측 잡기 자세를 평가한다.

실험 결과

연구 질문

  • RQ1다중모달 LLM이 혼잡한 실제 환경에서 암묵적 인간 지시를 효과적으로 해석하고 정확한 잡기 자세를 생성하는 데에 활용될 수 있는가?
  • RQ2LLM에서 유도된 텍스트 특징 통합이 직접 시각-언어 모델 통합과 비교해 잡기 자세 예측 성능을 어떻게 향상시키는가?
  • RQ3로봇 잡기 작업에서 명시적 지시와 암묵적 지시 간의 성능 격차는 얼마이며, 통합된 모델이 둘 다 처리할 수 있는가?
  • RQ4특수 토큰 식별 전략이 LLM 출력에서 대상 물체 식별의 관련성과 정확도를 얼마나 향상시키는가?
  • RQ5제안된 모델이 훈련 중에 볼 수 없었던 새로운 물체나 부품에 대해 암묵적 지시 조건 하에서도 얼마나 일반화되는가?

주요 결과

  • 제안된 추론 잡기 모델은 암묵적 지시 하에서 실제 환경에서 물체를 잡는 데 25/40의 성공률을 기록하였으며, CLIP+GR-ConvNet 기준선(16/40 성공률)보다 뚜렷이 뛰어나다.
  • 암묵적 지시에 대해 40次 시험 중 39회에서 정확한 대상 물체 이름을 식별하여 강력한 추론 및 해석 능력을 입증하였다.
  • 잡기 자세 정확도는 제안 모델이 25/40, 기준선이 15/40로, 더 나은 잡기 예측 품질을 보였다.
  • 암묵적 지시 하에서 부품 잡기 성능은 제안 모델이 6/10, 기준선이 2/10으로, 더 나은 일반화 능력을 보였다.
  • 튜닝된 LLaVA 모델은 강력한 추론 능력을 유지하여 GPT-4 평가자 평가에서 7.43/10을 기록하였으며, 원본 LLaVA-7B-v0의 8.25/10과 유사한 성능을 보였다.
  • 새로운 추론 잡기 벤치마크 데이터셋은 64개의 물체, 109개의 부품, 1730개의 추론 지시, 약 1억 개의 잡기 자세를 포함하며, 암묵적 지시 이해의 종합적 평가를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.