Skip to main content
QUICK REVIEW

[논문 리뷰] Recognizing Object Affordances to Support Scene Reasoning for Manipulation Tasks

Fu-Jen Chu, Ruinian Xu|arXiv (Cornell University)|2019. 09. 12.
Robot Manipulation and Learning인용 수 7
한 줄 요약

이 논문은 자기주의 어텐션 메커니즘과 보조적인 접근성 속성 예측을 통해 알려지지 않은 물체 카테고리 간의 제로샷 일반화를 가능하게 하는 카테고리 무관 접근성 인식 네트워크인 AffContext를 제안한다. 이는 최신 기술 수준의 접근성 세그멘테이션 성능를 달성하며, 목표 지향적 조작을 위한 상징적 계획과 성공적으로 통합되어 실세계 실험에서 알려지지 않은 물체를 사용할 때 88%의 작업 완료율을 보였다.

ABSTRACT

Affordance information about a scene provides important clues as to what actions may be executed in pursuit of meeting a specified goal state. Thus, integrating affordance-based reasoning into symbolic action plannning pipelines would enhance the flexibility of robot manipulation. Unfortunately, the top performing affordance recognition methods use object category priors to boost the accuracy of affordance detection and segmentation. Object priors limit generalization to unknown object categories. This paper describes an affordance recognition pipeline based on a category-agnostic region proposal network for proposing instance regions of an image across categories. To guide affordance learning in the absence of category priors, the training process includes the auxiliary task of explicitly inferencing existing affordances within a proposal. Secondly, a self-attention mechanism trained to interpret each proposal learns to capture rich contextual dependencies through the region. Visual benchmarking shows that the trained network, called AffContext, reduces the performance gap between object-agnostic and object-informed affordance recognition. AffContext is linked to the Planning Domain Definition Language (PDDL) with an augmented state keeper for action planning across temporally spaced goal-oriented tasks. Manipulation experiments show that AffContext can successfully parse scene content to seed a symbolic planner problem specification, whose execution completes the target task. Additionally, task-oriented grasping for cutting and pounding actions demonstrate the exploitation of multiple affordances for a given object to complete specified tasks.

연구 동기 및 목표

  • 물체 카테고리 사전 지식에 의존하지 않고 새로운 물체 카테고리 간의 제로샷 접근성 인식을 가능하게 하기 위해.
  • 카테고리 정보를 인스턴스 특징 학습에서 분리하여 알려지지 않은 물체에 대한 접근성 세그멘테이션의 일반화 성능를 향상시키기 위해.
  • 물체 사전 지식이 없는 상황에서 영역 제안 내에서 접근성 속성을 예측하는 보조 과제를 통해 특징 학습을 향상시키기 위해.
  • 목표 지향적 조작을 위해 학습된 접근성을 PDDL 호환 상태 유지 모듈을 통해 상징적 계획에 통합하기 위해.
  • 자신의 접근성 기반 계획을 사용하는 다중 접근성(예: 자르기, 두드리기)을 포함한 실세계 조작 작업에 프레임워크를 평가하기 위해.

제안 방법

  • 카테고리 레이블에 의존하지 않고 물체 인스턴스 영역을 생성하는 카테고리 무관 영역 제안 네트워크.
  • 각 영역 제안 내에서 존재하는 접근성을 추론하기 위해 보조 속성 예측 헤드를 활용하여 특징 학습을 안내한다.
  • 각 인스턴스 영역 내 픽셀 간의 장거리 문맥적 의존성을 캡처하기 위해 자기주의 어텐션 메커니즘을 사용하여 세그멘테이션 정확도를 향상시킨다.
  • 접근성 세그멘테이션과 접근성 속성 예측을 동시에 수행하는 다중 과제 학습을 통해 네트워크를 엔드 투 엔드로 훈련시킨다.
  • 예측된 접근성을 Planning Domain Definition Language (PDDL) 상태 유지 모듈에 매핑하여 상징적 계획 통합을 수행한다.
  • 접근성 기반 계획을 사용하는 순차적이고 목표 지향적인 행동을 포함한 실세계 조작 작업에서 시스템을 평가한다.

실험 결과

연구 질문

  • RQ1물체 카테고리 사전 지식에 의존하지 않고도 접근성 인식이 알려지지 않은 물체 카테고리로 일반화될 수 있는가?
  • RQ2카테고리 감독 없이 보조 접근성 속성 예측이 특징 학습에 어떻게 기여하는가?
  • RQ3카테고리에 무관한 환경에서 자기주의 어텐션 메커니즘이 접근성 세그멘테이션 성능를 얼마나 향상시키는가?
  • RQ4AffContext에서 유도된 접근성 인식이 복잡한 목표 지향적 조작 작업을 위한 상징적 계획기의 시드를 성공적으로 제공할 수 있는가?
  • RQ5실세계 실행 과정에서 인지-행동 파이프라인의 성능는 어떻게 저하되며, 주요 오류 원인은 무엇인가?

주요 결과

  • AffContext는 새로운 카테고리 분할 평가 프로토콜을 사용하여 UMD 데이터셋에서 96%의 접근성 인식 정확도를 달성하며, 이는 이전 최신 기술 수준의 방법들을 능가한다.
  • 이 프레임워크는 알려지지 않은 물체 카테고리가 포함된 11개의 실세계 조작 작업에서 88%의 작업 완료율을 기록한다.
  • 인지-행동 파이프라인은 인지 성공률 94%에서 실행 성공률 83%로 11%의 성능 저하를 보이며, 주로 시각적 추론 모듈의 오류 때문인 것으로 분석된다.
  • 자르기 및 두드리기 동작을 위한 목표 지향적 그립핑이 물체당 다중 접근성을 성공적으로 활용하여, 복잡한 조작 능력을 검증한다.
  • 88%의 작업 완료율은 몸체 기반 그립핑과 접근성 기반 조작 분야에서 발표된 결과들 중 상위 수준에 속한다.
  • 시스템은 PDDL 기반으로 시각적 접근성 인식과 상징적 계획을 성공적으로 통합하여 시간적으로 분리된 작업 간의 목표 지향적 조작을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.