Skip to main content
QUICK REVIEW

[논문 리뷰] SceneGraphFusion: Incremental 3D Scene Graph Prediction from RGB-D Sequences

Shun-Cheng Wu, Johanna Wald|arXiv (Cornell University)|2021. 03. 27.
3D Shape Modeling and Analysis참고 문헌 60인용 수 8
한 줄 요약

SceneGraphFusion는 부분적이고 불완전한 데이터를 다룰 수 있는 새로운 주목적 메커니즘을 갖춘 그래프 신경망을 사용하여 RGB-D 시퀀스에서 실시간으로 증분적인 3D 시나리오 그래프 예측을 위한 첫 번째 방법을 제안한다. 이는 3D 시나리오 그래프 예측 및 팬옵틱 세그멘테이션 분야에서 최고 성능를 달성하며, 35Hz로 작동하여 동적인 환경에서 전역적으로 일관된 의미 맵핑을 가능하게 한다.

ABSTRACT

Scene graphs are a compact and explicit representation successfully used in a variety of 2D scene understanding tasks. This work proposes a method to incrementally build up semantic scene graphs from a 3D environment given a sequence of RGB-D frames. To this end, we aggregate PointNet features from primitive scene components by means of a graph neural network. We also propose a novel attention mechanism well suited for partial and missing graph data present in such an incremental reconstruction scenario. Although our proposed method is designed to run on submaps of the scene, we show it also transfers to entire 3D scenes. Experiments show that our approach outperforms 3D scene graph prediction methods by a large margin and its accuracy is on par with other 3D semantic and panoptic segmentation methods while running at 35 Hz.

연구 동기 및 목표

  • 스트리밍 RGB-D 데이터에서 실시간으로 증분적인 3D 시나리오 그래프 구축을 가능하게 하여 부분적이고 불완전하며 동적인 기하학적 구조의 과제를 해결한다.
  • 시간이 지남에 따라 하위 맵의 예측을 융합하여 전역적으로 일관된 의미적 시나리오 그래프를 개발함으로써 공간적·시간적 일관성을 확보한다.
  • 증분 학습 중 부분적인 3D 포인트 클라우드에서 누락된 노드와 엣지를 다룰 수 있는 새로운 주목적 메커니즘을 도입한다.
  • 같은 부품 간 관계를 학습함으로써 의미적 및 인스턴스 수준의 이해를 통합하여 팬옵틱 세그멘테이션과 유사하게 작동한다.
  • 대규모 벤치마크에서 실시간 성능(35Hz)을 유지하면서도 3D 시나리오 그래프 예측의 높은 정확도를 달성한다.

제안 방법

  • 이 방법은 기하학적 세그멘테이션을 사용하여 RGB-D 시퀀스에서 기하학적 형태를 가진 장면 구성 요소를 추출하고, 초기 장면 노드를 형성한다.
  • 그래프 신경망(GNN)은 이웃 세그먼트의 특징을 집계하며, 프레임 단위로 노드 및 엣지 특징을 증분적으로 갱신한다.
  • 부분적이고 누락된 엣지를 고려한 새로운 자기 주목적 메커니즘이 도입되어, 불완전하고 동적인 그래프에서 주목적 가중치를 계산한다.
  • GNN은 다층 특징 전파를 활용하며, 하위 레이어의 특징을 캐시하고 재사용하여 노드의 일부만 수정될 경우 업데이트를 가속화한다.
  • 새로운 관계 유형인 'same part'을 도입하여 세그먼트를 융합하여 일관된 3D 인스턴스를 형성하고, 팬옵틱 스타일의 예측을 가능하게 한다.
  • 변경되지 않은 노드에서 캐시된 특징을 재사용하는 메모리 효율적인 업데이트 전략을 통해 예측 결과를 전역적으로 일관된 3D 시나리오 그래프에 융합한다.

실험 결과

연구 질문

  • RQ1RGB-D 시퀀스에서 실시간으로 증분적으로 3D 시나리오 그래프를 구성하면서도 전역 일관성을 유지할 수 있는가?
  • RQ2증분 학습 중에 누락된 노드와 엣지를 가진 부분적이고 불완전한 3D 데이터를 효과적으로 다룰 수 있는 그래프 신경망은 어떻게 설계할 수 있는가?
  • RQ3새로운 주목적 메커니즘이 동적이고 불완전한 관측 조건 하에서 3D 시나리오 그래프 예측 성능을 향상시킬 수 있는가?
  • RQ4제안된 방법이 최신 3D 의미 및 팬옵틱 세그멘테이션 방법과 비교해 어느 정도 유사한 성능을 달성할 수 있는가?
  • RQ5'same part' 관계의 통합이 인스턴스 수준 이해를 향상시키고 전체 시나리오 그래프 품질을 향상시키는가?

주요 결과

  • SceneGraphFusion는 3D 시나리오 그래프 예측에서 평균 IoU 49.3%를 기록하여 이전 방법들보다 크게 뛰어난 성능를 보였다.
  • 이 방법은 35Hz로 작동하여 스트리밍 RGB-D 데이터에서 정확도를 희생시키지 않고 실시간 운영이 가능했다.
  • ScanNet v2 오픈 테스트 세트에서 '누락 건너뛰기' 전략을 사용했을 때 PQ 점수는 36.3%를 기록했으며, PQ 및 RQ 지표 모두 PanopticFusion를 뛰어넘었다.
  • 제거 실험 결과, 제안된 주목적 메커니즘이 GAT 대비 평균 IoU 15.8% 향상, SDPA 대비 16.5% 향상된 것으로 나타났다.
  • 'same part' 관계의 통합은 인스턴스 수준 예측을 크게 향상시켜 기준 모델 대비 PQ를 4.8점 향상시켰다.
  • 부분적 관측 조건에서도 높은 정확도를 유지하여 p50 임계값에서 평균 IoU 41.9%를 기록했으며, 데이터 누락에 대한 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.