Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Environment-Aware Affordance for 3D Articulated Object Manipulation under Occlusions

Ruihai Wu, Kai Cheng|arXiv (Cornell University)|2023. 09. 14.
Robot Manipulation and Learning인용 수 5
한 줄 요약

이 논문은 점 수준의 표현과 대비 학습 접근법을 활용하여 복잡한 가림체 조합에 일반화할 수 있도록, 가림이 있는 상황에서 3D 관절 구조 물체 조작을 위한 환경 인식 능력 프레임워크를 제안한다. 국소적으로 가림 효과를 모델링하고 단일 가림체 시나리오에서 데이터 효율적인 대비 학습을 통해, 새로운 다중 가림체 환경에서도 조작 가능한 점을 높은 정확도로 예측할 수 있으며, 시뮬레이션 및 실제 스캔 환경에서 기존 방법들을 능가한다.

ABSTRACT

Perceiving and manipulating 3D articulated objects in diverse environments is essential for home-assistant robots. Recent studies have shown that point-level affordance provides actionable priors for downstream manipulation tasks. However, existing works primarily focus on single-object scenarios with homogeneous agents, overlooking the realistic constraints imposed by the environment and the agent's morphology, e.g., occlusions and physical limitations. In this paper, we propose an environment-aware affordance framework that incorporates both object-level actionable priors and environment constraints. Unlike object-centric affordance approaches, learning environment-aware affordance faces the challenge of combinatorial explosion due to the complexity of various occlusions, characterized by their quantities, geometries, positions and poses. To address this and enhance data efficiency, we introduce a novel contrastive affordance learning framework capable of training on scenes containing a single occluder and generalizing to scenes with complex occluder combinations. Experiments demonstrate the effectiveness of our proposed approach in learning affordance considering environment constraints. Project page at https://chengkaiacademycity.github.io/EnvAwareAfford/

연구 동기 및 목표

  • 실제 환경에서 가림과 물리적 제약 조건이 존재하는 3D 관절 구조 물체 조작 문제를 해결하기 위해.
  • 가림체 수, 형상, 위치, 자세의 다양성이 초래하는 시나리오 복잡성의 조합 폭발 문제를 해결하기 위해.
  • 객체 중심의 조작 가능 우선 지식과 환경 및 에이전트 제약 조건을 통합한 점 수준의 능력 학습을 위해.
  • 단일 가림체 학습 시나리오에서 복잡한 다중 가림체 테스트 시나리오로의 일반화를 높은 데이터 효율성으로 가능하게 하기 위해.
  • 외부 가림체와 자기 가림을 모두 고려한 충돌 인식 능력 예측을 통해 실제 시나리오에서의 조작 성공률을 향상시키기 위해.

제안 방법

  • 환경에 민감한 능력을 점 수준 표현으로 정의하여, 환경 제약 조건과 로봇 형태를 고려한 조작 가능 우선 지식을 코딩한다.
  • 가장 중요한 사실은 오직 가림체의 局부 영역만이 조작에 영향을 미치며, 이는 시나리오 이해의 효과적 복잡도를 감소시킨다.
  • 단일 가림체 시나리오에서 학습하고 다중 가림체 조합으로 일반화할 수 있는 새로운 대비 능력 학습 프레임워크를 제안한다.
  • 로봇, 대상 물체, 가림체 간의 공간적 관계를 모델링하기 위해 가림 필드(OF) 모듈을 통합하여 충돌 인식 예측을 향상시킨다.
  • SAPIEN, PartNet-Mobility, ShapeNet 데이터셋 기반의 합성 상호작용 환경을 활용해 신경망을 훈련시킨다.
  • 정확도와 불확실성 추정을 동시에 출력하기 위해 듀얼 헤드 예측 헤드를 도입하여, 새로운 시나리오에서의 강인성을 향상시킨다.

실험 결과

연구 질문

  • RQ1단일 가림체 시나리오에서 훈련된 모델이 3D 관절 구조 물체 조작에서 복잡한 다중 가림체 시나리오로 일반화할 수 있는가?
  • RQ2점 수준의 능력이 가림체 형상, 위치, 로봇 자세 등의 환경 제약 조건에 민감하게 반응하도록 하는 방법은 무엇인가?
  • RQ3조합적 시나리오 복잡성 속에서 환경 인식 능력의 데이터 효율적 학습을 위해 필수적인 구성 요소는 무엇인가?
  • RQ4대비 학습이 가림 상태에서 조작 가능한 점과 불가능한 점을 구분하는 데 모델의 능력을 얼마나 향상시키는가?
  • RQ5모델은 실제 스캔된 시나리오에서 외부 충돌과 자기 가림을 모두 피하는 능력을 예측할 수 있는가?

주요 결과

  • 제안된 방법은 복잡한 가림이 있는 시나리오에서 밀기 작업에 43.52%의 조작 정확도, 당기기 작업에 36.19%의 조작 정확도를 달성하여 모든 기준 방법들을 능가한다.
  • 새로운 가림체 조합에서 모델은 밀기 작업에 대해 F-스코어 86.11%, 평균 정밀도 83.58%를 기록하였고, 당기기 작업에 대해 F-스코어 75.96%, 평균 정밀도 75.18%를 기록하였다.
  • 절단 실험 결과, 가림 필드(OF)를 제거한 경우(Ours w/o OF)는 새로운 밀기 작업에서 F-스코어 69.02%, AP 66.94%로 성능 저하가 발생하여, 충돌 인식에 있어 OF의 중요성을 입증한다.
  • 대비 학습을 제거한 경우(Ours w/o CL)는 예측의 확신도가 낮아지며, 새로운 밀기 작업에서 F-스코어 74.02%, AP 71.62%로 성능 저하가 발생하여, 대비 학습이 분류 능력 향상에 기여하는 것으로 나타났다.
  • 모델은 실제 스캔된 시나리오로도 효과적으로 일반화되며, 자기 충돌과 외부 가림을 피하는 타당한 능력 예측을 생성한다. 이는 그림 7에서 검증되었다.
  • 동일한 시나리오 내에서 다른 로봇 위치에 따라 다른 능력 예측이 도출된다 (그림 6), 이는 모델이 에이전트 자세와 환경 맥락에 민감하게 반응함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.