[논문 리뷰] Hierarchical Planning for Long-Horizon Manipulation with Geometric and Symbolic Scene Graphs
이 논문은 두 수준의 시나리오 그래프—기하학적(6-DoF 물체 자세)과 상징적(의미 관계)—를 사용하여 장기 예측 조작을 위한 시각 기반 계층적 계획 프레임워크를 제안한다. 이 그래프들은 그래프 신경망(GNNs)을 통해 처리되어 신경-기호 작업 계획 및 그래프 기반 운동 생성을 가능하게 한다. 이 방법은 실제 작업에서 70.6%의 성공률과 89.6%의 서브목표 완료율을 달성하였으며, 검색 기반 계획자보다 추론 속도가 4개 지수 차수 빠르다.
We present a visually grounded hierarchical planning algorithm for long-horizon manipulation tasks. Our algorithm offers a joint framework of neuro-symbolic task planning and low-level motion generation conditioned on the specified goal. At the core of our approach is a two-level scene graph representation, namely geometric scene graph and symbolic scene graph. This hierarchical representation serves as a structured, object-centric abstraction of manipulation scenes. Our model uses graph neural networks to process these scene graphs for predicting high-level task plans and low-level motions. We demonstrate that our method scales to long-horizon tasks and generalizes well to novel task goals. We validate our method in a kitchen storage task in both physical simulation and the real world. Our experiments show that our method achieved over 70% success rate and nearly 90% of subgoal completion rate on the real robot while being four orders of magnitude faster in computation time compared to standard search-based task-and-motion planner.
연구 동기 및 목표
- 고차원의 액션 공간과 조합 복잡성을 지닌 실제 환경에서 장기 예측 조작 계획의 과제를 해결하기 위해.
- 수동으로 지정된 상징적 규칙과 비용이 많이 드는 검색 절차에 의존하는 전통적인 작업 및 운동 계획(TAMP)의 한계를 극복하기 위해.
- 광범위한 재학습이나 사전 정의된 도메인 지식 없이도 새로운 장기 작업에 일반화할 수 있도록 하기 위해.
- 구조화된 시나리오 표현을 사용하여 시각 인식, 상징적 추론 및 운동 생성을 통합한 종단 간 훈련 가능한 통합 프레임워크를 구현하기 위해.
제안 방법
- 이 방법은 이중 수준의 시나리오 그래프 표현을 사용한다: 기하학적 시나리오 그래프는 물체의 6-DoF 자세와 공간 관계를 인코딩하고, 상징적 시나리오 그래프는 엔티티 간 의미 관계를 캡처한다.
- 신경망, 특히 그래프 신경망(GNNs)을 사용하여 두 시나리오 그래프 수준을 처리하여 고수준 작업 계획과 저수준 운동 생성을 수행한다.
- 고수준 작업 계획은 PDDL 기반의 신경-기호 회귀 계획자로 최종 목표에서 다음 서브목표를 예측하여 고비용의 검색 절차를 회피한다.
- 저수준 운동 생성은 GNN을 사용하여 기하학적 시나리오 그래프에 기반해 직접 운동 파라미터(예: 관절 각도, 종단 기구 경로)를 예측한다.
- 짧은 시범 트레이젝터리에서 훈련함으로써, 이 프레임워크는 더 긴 및 새로운 작업에 대해 제로샷 일반화를 가능하게 한다.
- RGB 이미지에서의 자세 추정을 통해 실시간으로 시나리오 그래프를 구성할 수 있으며, 이는 실제 구현에서 시각 기반을 제공한다.
실험 결과
연구 질문
- RQ1이중 수준의 시나리오 그래프를 기반으로 하는 계층적 계획 프레임워크는 훈련 분포를 초월한 장기 예측 조작 작업에 일반화될 수 있는가?
- RQ2GNN 기반의 신경-기호 계획자와 전통적인 검색 기반 계획자 간의 추론 속도와 성공률에서의 성능 비교는 어떻게 되는가?
- RQ3그래프 기반 운동 생성은 재학습 없이도 새로운 물체 구성에 얼마나 일반화될 수 있는가?
- RQ4GNNs의 관계 기반 인덕티브 편향이 계획 및 운동 예측 성능에 미치는 영향은 무엇인가?
- RQ5실행 실패 및 과도한 실행 실패는 실제 구현에서 성능에 어떤 영향을 미치는가?
주요 결과
- 제안된 방법은 2~6개의 물체를 포함한 실제 실험에서 평균 70.6%의 성공률과 89.6%의 서브목표 완료율을 달성하였다.
- 정확한 자세가 제공되는 시뮬레이션 환경에서, 2개 물체 작업에 대해 92%의 성공률, 6개 물체 작업에 대해 67%의 성공률를 기록하였으며, 무작위 샘플링 및 MLP 기반 베이스라인보다 뛰어난 성능을 보였다.
- 신경-기호 계획자는 PDDLStream 기반의 검색 기반 계획자보다 4개 지수 차수 빠른 성능을 보였으며, 6개 물체 작업의 경우 작업 계획 시간을 약 400초에서 0.32초로 단축시켰다.
- 그래프 기반 운동 생성은 무작위 샘플링 및 완전 연결 네트워크(MLP)보다 뛰어난 성능을 보였으며, GNN은 관계 기반 인덕티브 편향 덕분에 우수한 일반화 성능을 보였다.
- 실행 실패율은 작업 복잡도가 증가함에 따라 증가하였으며(2개 물체 시 7%에서 6개 물체 시 33%로 증가), 과도한 실행 실패율은 모든 작업에서 1% 미만을 유지하였다.
- 이 방법은 강력한 제로샷 일반화 성능을 보였으며, 훈련 시범 트레이젝터리보다 더 긴 작업도 성공적으로 처리하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.