Skip to main content
QUICK REVIEW

[논문 리뷰] FFB6D: A Full Flow Bidirectional Fusion Network for 6D Pose Estimation

Yisheng He, Haibin Huang|arXiv (Cornell University)|2021. 03. 03.
Robot Manipulation and Learning참고 문헌 68인용 수 13
한 줄 요약

FFB6D는 단일 RGBD 이미지에서 외관과 기하학적 표현을 동시에 학습하기 위한 전체 흐름 이중 방향 융합 네트워크를 제안한다. 별도의 RGB 및 깊이 네트워크의 인코딩 및 디코딩 레이어 전반에 걸쳐 특징을 융합하고, SIFT-FPS 키포인트 선택 방법을 사용함으로써, 후처리 보정 없이도 YCB-Video, LineMOD, Occlusion LineMOD 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

In this work, we present FFB6D, a Full Flow Bidirectional fusion network designed for 6D pose estimation from a single RGBD image. Our key insight is that appearance information in the RGB image and geometry information from the depth image are two complementary data sources, and it still remains unknown how to fully leverage them. Towards this end, we propose FFB6D, which learns to combine appearance and geometry information for representation learning as well as output representation selection. Specifically, at the representation learning stage, we build bidirectional fusion modules in the full flow of the two networks, where fusion is applied to each encoding and decoding layer. In this way, the two networks can leverage local and global complementary information from the other one to obtain better representations. Moreover, at the output representation stage, we designed a simple but effective 3D keypoints selection algorithm considering the texture and geometry information of objects, which simplifies keypoint localization for precise pose estimation. Experimental results show that our method outperforms the state-of-the-art by large margins on several benchmarks. Code and video are available at \url{https://github.com/ethnhe/FFB6D.git}.

연구 동기 및 목표

  • 부족한 무늬, 반사성 표면, 부분 가림 상황에서 6자리 객체 자세 추정 문제를 해결하기 위해.
  • 전체 네트워크 흐름 전반에서 외관(RGB)과 기하학(깊이) 정보를 완전히 융합하여 표현 학습을 향상시키기 위해.
  • ICP 보정과 같은 시간 소모가 큰 후처리 단계에 의존하지 않기 위해.
  • 더 나은 국소화를 위해 무늬와 기하학적 특징을 모두 활용하는 강력한 3차원 키포인트 선택 방법을 개발하기 위해.

제안 방법

  • 별도의 RGB 및 깊이 스트림 네트워크의 모든 인코딩 및 디코딩 레이어에 융합 모듈을 적용하는 전체 흐름 이중 방향 융합 기법을 도입한다.
  • 이중 브랜치 아키텍처를 사용한다: 하나의 브랜치는 ResNet34-PSPNet를 통해 RGB 이미지를 처리하고, 다른 브랜치는 3D 포인트 클라우드(XYZ + 노멀 맵)를 RandLA-Net 또는 3D CNN을 통해 처리한다.
  • 각 레이어에서 이중 방향 특징 융합을 적용하여, 외관 브랜치와 기하학 브랜치 간의 국소 및 글로벌 표현이 상호 보완적으로 향상되도록 한다.
  • 무늬와 기하학적 특징을 기반으로 주목할 만한 3차원 키포인트를 선택하는 SIFT-FPS 알고리즘을 제안하여 국소화 정확도를 향상시킨다.
  • 예측된 3차원 키포인트 좌표와 그 2차원 투영을 사용하여 PVN3D 스타일의 파이프라인을 채택하여 6자리 자세 추정을 수행한다.
  • 후처리 보정 없이 엔드 투 엔드 학습을 수행함으로써 실시간 추론이 가능하고, 자세 예측의 공동 최적화를 달성한다.

실험 결과

연구 질문

  • RQ1이중 스트림 네트워크의 모든 레이어에서 이중 방향 융합이 특징 연결 또는 후기 융합보다 6자리 자세 추정 성능을 향상시킬 수 있는가?
  • RQ2외관과 기하학 표현의 공동 학습이 가림 및 반사성 표 superficies에 대한 강건성을 향상시키는가?
  • RQ3거리 기반 선택보다 무늬와 기하학 정보를 통합한 키포인트 선택 전략이 더 나은 성능을 낼 수 있는가?
  • RQ4전체 흐름 융합이 어려운 상황에서 고립된 RGB 또는 깊이 처리보다 더 나은 성능을 내는가?
  • RQ5완전히 엔드 투 엔드 네트워크가 ICP 또는 기타 후처리 단계 없이 최신 기술 수준(SOTA) 성능을 달성할 수 있는가?

주요 결과

  • YCB-Video 데이터셋에서 ADD-0.1d 지표 기준 평균 정밀도 99.7%를 달성하여 이전 최신 기술 수준(SOTA) 방법을 초월한다.
  • Occlusion-LineMOD 데이터셋에서 평균 ADD-0.1d 점수 66.2%를 기록하여 PVN3D(63.2%) 및 기타 최신 기술 수준 방법을 능가한다.
  • LineMOD 데이터셋에서 평균 정밀도 98.7%를 달성하여 PVN3D(94.3%) 및 DenseFusion 기반 접근법을 크게 앞서간다.
  • SIFT-FPS 키포인트 선택 방법은 강한 무늬와 기하학적 구조를 가진 주목할 만한 영역을 선호함으로써 키포인트 국소화 정확도를 향상시킨다.
  • 정성적 결과 분석에서 FFB6D는 PVN3D 및 DenseFusion보다 가림 및 반사성 물체 처리에 더 강건함을 보였다.
  • 절단 실험 결과 전체 흐름 이중 방향 융합이 초기 또는 후기 융합 전략보다 열등한 성능를 낼 수 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.