Skip to main content
QUICK REVIEW

[논문 리뷰] RAFT-3D: Scene Flow using Rigid-Motion Embeddings

Zachary Teed, Jia Deng|arXiv (Cornell University)|2020. 12. 01.
Advanced Vision and Imaging참고 문헌 54인용 수 5
한 줄 요약

RAFT-3D는 강성 운동 임bedding과 기하 일관성을 강제하는 미분 가능 Dense-SE3 레이어를 사용하여 3D 시나리오 플로우 추정을 위한 엔드 투 엔드 딥 러닝 프레임워크를 제안한다. 이는 인스턴스 수준의 감독 없이도 최신 기술 수준의 성능을 달성하여 FlyingThings3D에서 3D 정확도(δ<0.05)를 83.7%로 향상시키고, KITTI에서 EPE 5.77을 기록하며 이전 방법들을 능가한다.

ABSTRACT

We address the problem of scene flow: given a pair of stereo or RGB-D video frames, estimate pixelwise 3D motion. We introduce RAFT-3D, a new deep architecture for scene flow. RAFT-3D is based on the RAFT model developed for optical flow but iteratively updates a dense field of pixelwise SE3 motion instead of 2D motion. A key innovation of RAFT-3D is rigid-motion embeddings, which represent a soft grouping of pixels into rigid objects. Integral to rigid-motion embeddings is Dense-SE3, a differentiable layer that enforces geometric consistency of the embeddings. Experiments show that RAFT-3D achieves state-of-the-art performance. On FlyingThings3D, under the two-view evaluation, we improved the best published accuracy (d &lt; 0.05) from 34.3% to 83.7%. On KITTI, we achieve an error of 5.77, outperforming the best published method (6.31), despite using no object instance supervision. Code is available at https://github.com/princeton-vl/RAFT-3D.

연구 동기 및 목표

  • 인스턴스 수준의 감독(예: 경계 상자 또는 세그멘테이션 마스크)이 필요 없는 엔드 투 엔드 미분 가능한 아키텍처를 개발하는 것.
  • 강성 운동 임베딩을 통해 픽셀을 강성 물체로 부드럽게 그룹화하는 방식으로 3D 운동을 조밀한 SE3 필드로 모델링하는 것.
  • 무작위로 펼쳐진 가우스-뉴턴 반복 기반의 기하 일관성을 강제하는 미분 가능한 최적화 레이어인 Dense-SE3를 사용하여 운동 필드의 기하 일관성을 확보하는 것.
  • 표준 벤치마크(예: FlyingThings3D 및 KITTI)에서 정확도를 향상시키면서도 알려지지 않은 물체에 대한 일반화 능력을 유지하는 것.
  • 경계 상자나 세그멘테이션 마스크가 필요 없이 3D 시나리오 플로우 진짜값만으로도 자기 감독을 가능하게 하는 것.

제안 방법

  • RAFT-3D는 2D 플로우 대신 SE3(특수 올리자드 군)에서 조밀한 3D 운동 필드를 추정하기 위해 RAFT 광학 플로우 프레임워크를 확장한다.
  • 시각적 유사성을 픽셀 쌍 간에 캡처하기 위해 스테레오 또는 RGB-D 영상 쌍에서 추출한 특징들로부터 4차원 상관관계 볼륨을 구축한다.
  • GRU 기반 업데이트 연산자를 사용하여 조밀한 SE3 운동 추정 필드를 유지하고 반복적으로 업데이트하며, 대응 관계와 임베딩 업데이트를 예측한다.
  • 강성 운동 임베딩은 픽셀당 벡터로, 유사한 임베딩은 동일한 3D 운동을 공유하는 픽셀 그룹을 나타낸다.
  • Dense-SE3는 현재의 임베딩과 대응 관계 추정치를 기반으로 이웃 영역 내 모든 픽셀 쌍에 대해 최소 제곱 최적화 문제를 풀어 기하 일관성을 강제하는 미분 가능한 레이어이다.
  • 역 깊이 수정을 통합하고, 필요에 따라 양방향 라플라시안 스무딩 레이어를 적용하여 운동 경계에서의 임베딩 집계를 향상시킨다.

실험 결과

연구 질문

  • RQ1경계 상자나 세그멘테이션 마스크와 같은 인스턴스 수준의 감독이 필요 없이, 미분 가능한 엔드 투 엔드 딥 네트워크가 정확한 3D 시나리오 플로우를 추정할 수 있는가?
  • RQ2강성 운동 임베딩이 3D 운동 필드의 기하 일관성을 유지하면서 픽셀을 강성 운동 물체로 연속적으로 그룹화하는 데 효과적인가?
  • RQ3미분 가능한 기하 제약 조건 레이어(Dense-SE3)의 통합이 기존의 학습 기반 접근 방식에 비해 3D 운동 정확도를 크게 향상시키는가?
  • RQ4RAFT-3D는 FlyingThings3D와 KITTI와 같은 표준 벤치마크에서 최신 기술 수준의 방법들과 비교해 볼 때, 특히 알려지지 않은 물체 카테고리에 대해 0-샷 일반화 성능이 어떻게 되는가?
  • RQ5이웃 반경, 반복 횟수, 양방향 라플라시안 스무딩과 같은 아키텍처 구성 요소들이 최종 정확도와 강건성에 미치는 영향은 무엇인가?

주요 결과

  • RAFT-3D는 이중 시야 평가에서 FlyingThings3D에서 3D 정확도(δ<0.05)를 83.7%로 달성하여 이전 최고 성능인 34.3%에 비해 뚜렷한 향상을 이룩했다.
  • KITTI 데이터셋에서 RAFT-3D는 EPE 5.77을 기록하여, 인스턴스 수준의 감독을 전혀 사용하지 않았음에도 불구하고 가장 잘 발표된 방법(6.31)을 능가했다.
  • 절단 분석 결과, 이웃 반경을 256 픽셀로 설정할 경우 더 작은 반경이나 전체 이미지 최적화보다 더 우수한 성능을 보였으며, 이는 물체 크기에 대한 유용한 인덕티브 바이어스를 시사한다.
  • 업데이트 연산자에 역 깊이 수정을 통합함으로써 깊이 일관성을 활용하여 3D 지표가 향상되었으며, δ<0.05는 84.6%에서 87.1%로 증가했다.
  • 양방향 라플라시안 스무딩 레이어를 적용하면 δ<0.05에서 0.7% 향상되고 δ<0.10에서도 0.7% 향상되며, 평균 EPE에 변화가 없으며, 운동 경계의 일관성도 향상된다.
  • RAFT-3D는 4500만 개의 파라미터와 단일 GTX 1080Ti GPU를 사용하여 540x960 해상도 영상에서 386ms의 추론 시간으로 최신 기술 수준의 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.