[논문 리뷰] Interactive Visual Grounding of Referring Expressions for Human-Robot Interaction
INGRESS는 인간-로봇 상호작용에서 자연어 참조 표현의 상호작용적 시각 기반을 위한 신경망 기반 시스템입니다. 이 시스템은 두 단계의 접근 방식을 사용합니다. 첫 번째 단계에서는 후보 객체를 식별하기 위해 시각적 설명을 생성하고, 두 번째 단계에서는 쌍별 관계를 분석하여 모호성을 해소합니다. 이로 인해 RefCOCO에서 최신 기술 수준의 성능을 달성하였고, 실험에서 인간-로봇 상호작용의 품질도 뛰어나게 했습니다.
This paper presents INGRESS, a robot system that follows human natural language instructions to pick and place everyday objects. The core issue here is the grounding of referring expressions: infer objects and their relationships from input images and language expressions. INGRESS allows for unconstrained object categories and unconstrained language expressions. Further, it asks questions to disambiguate referring expressions interactively. To achieve these, we take the approach of grounding by generation and propose a two-stage neural network model for grounding. The first stage uses a neural network to generate visual descriptions of objects, compares them with the input language expression, and identifies a set of candidate objects. The second stage uses another neural network to examine all pairwise relations between the candidates and infers the most likely referred object. The same neural networks are used for both grounding and question generation for disambiguation. Experiments show that INGRESS outperformed a state-of-the-art method on the RefCOCO dataset and in robot experiments with humans.
연구 동기 및 목표
- 로봇이 실제 환경에서 제약 없는 자연어 지시어를 이해하고 물체 조작을 수행할 수 있도록 하기.
- 인간-로봇 상호작용 중 질문을 통해 참조 표현의 모호성을 동적으로 해소하기.
- 사전 정의된 템플릿 없이도 오픈 뷰포인트 물체 카테고리와 자유형 언어 표현을 지원하기.
- 언어 생성 및 모호성 해소를 통해 정확도와 인간-로봇 소통 품질을 향상시키기.
- 다양하고 예측할 수 없는 물체 및 복잡한 공간 관계를 포함한 정돈된 환경에서 일반화할 수 있는 시스템 개발하기.
제안 방법
- RGB-D 이미지에서 물체 후보를 생성하기 위해 Faster R-CNN 기반의 국소화 모듈 사용.
- 두 단계의 신경망을 적용: 첫 번째 단계에서는 LSTM을 사용해 이미지 영역에서 언어 표현을 생성하고, 이를 입력된 참조 표현과 매칭하여 후보 물체를 식별.
- 두 번째 단계에서는 다른 LSTM을 사용해 후보 물체 간의 관계 기술을 생성하고, 이를 입력된 관계 표현과 비교하여 참조된 물체를 추론.
- 모호성이 발생했을 때 모호성 해소 질문 생성과 기반 시스템에 동일한 신경망을 활용.
- 실제 환경 구현을 위해 Kinova Mico 로봇에 음성 입력과 RGB-D 센서 통합.
- 키워드 매칭 및 시점 인식 언어 모델링을 사용해 사용자 중심 시점(예: '내 왼쪽에')을 처리.
실험 결과
연구 질문
- RQ1신경망 기반 시스템이 오픈 뷰포인트, 실제 환경에서 제약 없는 참조 표현을 효과적으로 기반으로 삼을 수 있는가?
- RQ2로봇이 상호작용 질문 생성을 통해 자연어 지시어의 모호성을 어떻게 동적으로 해소할 수 있는가?
- RQ3기존의 분류 기반 방법에 비해 언어 생성을 통한 기반 기반의 정확도 향상과 인간-로봇 소통 향상 정도는 어느 정도인가?
- RQ4동일한 신경망 구성 요소를 기반 및 모호성 해소에 모두 사용할 수 있는가? 이를 통해 통합 아키텍처를 구현할 수 있는가?
- RQ5사용자는 상호작용적 기반 시나리오에서 로봇이 생성한 질문을 어떻게 인지하고 반응하는가?
주요 결과
- INGRESS는 RefCOCO 테스트 데이터셋에서 최신 기술 수준의 방법인 UMD Refexp를 능가하여 더 높은 기반 정확도를 확보했습니다.
- 인간-로봇 실험에서 INGRESS는 효과적인 모호성 해소 소통에 대해 5점 척도 평균 4.4점을 기록했으며, 기준값의 1.6점과 비교해 유의미하게 높았습니다(p < 0.001).
- 사용자 응답의 약 79%가 로봇의 언어 스타일을 반영하여 인간과 로봇 간 언어적 조율가능성이 확인되었습니다.
- 모호한 경우의 80%에서 시스템은 명확하고 구분 가능한 질문을 생성했으며, 실패 원인은 주로 가림 또는 복잡한 관계(예: '세 번째', '모든 네 개') 때문이었습니다.
- 로봇의 손짓 제스처는 질문만으로는 충분히 구분되지 않는 경우에 모호성 해소에 크게 기여했습니다.
- 참가자들은 자주 자신의 언어를 로봇의 어조에 맞추어 조정했으며, 이는 로봇의 언어 스타일이 인간의 의사소통 패턴에 영향을 줄 수 있음을 시사합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.