[논문 리뷰] INVIGORATE: Interactive Visual Grounding and Grasping in Clutter
INVIGORATE는 자연어를 사용하여 혼잡한 환경에서 상호작용적 시각적 기반 및 집기 작업을 가능하게 하기 위해 데이터 기반 딥 러닝과 모델 기반 POMDP 계획을 통합한 로봇 시스템이다. 물체 중심 POMDP 내에서 물체 검출, 시각적 기반, 질문 생성, 물체 차단 관계 추정을 위한 신경망을 결합함으로써, 시각적 가림과 언어적 모호성에도 불구하고 목표 물체를 식별하고 집는 데 83%의 성공률을 달성한다.
This paper presents INVIGORATE, a robot system that interacts with human through natural language and grasps a specified object in clutter. The objects may occlude, obstruct, or even stack on top of one another. INVIGORATE embodies several challenges: (i) infer the target object among other occluding objects, from input language expressions and RGB images, (ii) infer object blocking relationships (OBRs) from the images, and (iii) synthesize a multi-step plan to ask questions that disambiguate the target object and to grasp it successfully. We train separate neural networks for object detection, for visual grounding, for question generation, and for OBR detection and grasping. They allow for unrestricted object categories and language expressions, subject to the training datasets. However, errors in visual perception and ambiguity in human languages are inevitable and negatively impact the robot's performance. To overcome these uncertainties, we build a partially observable Markov decision process (POMDP) that integrates the learned neural network modules. Through approximate POMDP planning, the robot tracks the history of observations and asks disambiguation questions in order to achieve a near-optimal sequence of actions that identify and grasp the target object. INVIGORATE combines the benefits of model-based POMDP planning and data-driven deep learning. Preliminary experiments with INVIGORATE on a Fetch robot show significant benefits of this integrated approach to object grasping in clutter with natural language interactions. A demonstration video is available at https://youtu.be/zYakh80SGcU.
연구 동기 및 목표
- 시각적 가림과 언어적 모호성이 성능에 영향을 주는 혼잡한 환경에서의 강력한 물체 검색 문제를 해결한다.
- 인지적 불확실성과 언어 모호성을 다루기 위해 데이터 기반 신경망과 모델 기반 계획을 통합하여 실제 로봇 상호작용에서의 성능을 향상시킨다.
- 시각적 기반 또는 언어 이해에 불확실성이 있을 경우 질문 생성을 통해 상호작용적 모호성 해소를 가능하게 한다.
- 부분 관측 조건 하에서 물체 관계와 인지 신뢰도를 고려하여 행동 시퀀스를 최적화하는 시스템을 개발한다.
- 노이즈가 많은 시각 입력과 모호한 언어 지시어가 존재하는 현실 세계의 로봇 집기 작업에서 높은 성공률을 달성한다.
제안 방법
- 물체 검출, 언어적 참조 표현의 시각적 기반, 물체 차단 관계(OBR) 검출, 모호성 해소 질문 생성을 위한 별도의 딥 뉴럴 네트워크를 훈련한다.
- 신경망에서 유입되는 노이즈가 있는 관측치를 모델링하고 물체 정체성과 관계에 대한 믿음 상태를 유지하는 물체 중심 부분 관측 마르코프 결정 과정(POMDP)을 수립한다.
- 감지 실패와 시각적 및 언어적 인지의 불확실성을 반영하기 위해 확률적 관측 모델을 사용한다.
- 목표 식별에 대한 신뢰도가 낮을 경우 질문을 통해 정보를 수집하는 것과 같은 근사 최적의 행동 시퀀스를 생성하기 위해 POMDP 계획을 활용한다.
- 사람이 어떻게 해석할 가능성이 높은지를 예측하고 정보 수확량과 상호작용 비용을 균형 잡는 방식으로 질문 생성을 최적화한다.
- 모든 구성 요소를 통합된 파ip라인으로 통합하여 Fetch 로봇에 구현하여 실제 환경에서 평가한다.
실험 결과
연구 질문
- RQ1여러 물체가 설명과 일치할 경우 자연어 지시어의 모호성을 효과적으로 해결할 수 있는 로봇 시스템은 어떻게 설계할 수 있는가?
- RQ2시각적 가림과 노이즈가 많은 인지 조건 하에서 POMDP 프레임워크가 시각적 기반 및 집기 작업의 강건성에 얼마나 기여하는가?
- RQ3학습된 신경망이 복잡하고 고차원적인 인지 작업에서 오류 전파를 줄이기 위해 모델 기반 계획과 효과적으로 통합될 수 있는가?
- RQ4모호성 해소 질문을 통한 능동적 정보 확보는 혼잡한 환경에서 성공률에 어떻게 기여하는가?
- RQ5불확실성 인식 기반 추론은 엔드 투 엔드 신경망 기반 베이스라인 대비 전체 시스템 성능에 어떤 영향을 미치는가?
주요 결과
- INVIGORATE는 테스트 데이터셋에서 총 성공률 83%를 달성했으며, POMDP 통합이 없는 베이스라인보다 유의미하게 높은 성능을 보였다.
- 제거 분석 결과, 혼잡한 장면에서 강력한 성능을 내기 위해 인지 불확실성과 언어 모호성에 대한 추론이 필수적임을 확인했다.
- 시스템은 색상 정보를 기반으로 두 개의 원격 조종기 사이에서 참조를 구분하는 등 언어 참조의 모호성을 성공적으로 식별하고 해소했다.
- POMDP 기반 계획은 목표가 가려져 있거나 감지되지 않을 경우와 같은 감지 실패 상황에서도 효과적으로 대응할 수 있도록, 장애물 제거나 질문 요청과 같은 조치를 유도한다.
- 질문 생성의 크리틱 모듈은 환상적인 특성들을 걸러내고 색상과 같이 인간이 선호하는 특성들을 우선시함으로써 질문 품질을 향상시켰다.
- 실패 사례는 OBR 추정 및 감지의 강건성에 한계가 있음을 드러내었으며, 예를 들어 차단 물체가 감지되지 않거나 관계가 잘못 추론되었을 경우 잘못된 집기 행동이 발생하는 경우가 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.