[논문 리뷰] Robust RGB-based 6-DoF Pose Estimation without Real Pose Annotations
이 논문은 실제 자세 레이블을 사용하지 않고 LINEMOD 및 Occluded-LINEMOD에서 최신 기술 수준 성능을 달성하는 자기지도 학습 6-DoF 자세 추정 방법을 제안한다. 실재 이미지와 그들의 합성적으로 가림된 대응 이미지 간의 6-DoF 자세 일致성을 절단 기반 도메인 랜덤화 전략을 통해 강제함으로써, 심한 가림 상태에서도 강인성을 향상시키면서 동시에 레이블이 없는 실재 데이터를 시아모이즈 네트워크 아키텍처를 통해 활용한다.
While much progress has been made in 6-DoF object pose estimation from a single RGB image, the current leading approaches heavily rely on real-annotation data. As such, they remain sensitive to severe occlusions, because covering all possible occlusions with annotated data is intractable. In this paper, we introduce an approach to robustly and accurately estimate the 6-DoF pose in challenging conditions and without using any real pose annotations. To this end, we leverage the intuition that the poses predicted by a network from an image and from its counterpart synthetically altered to mimic occlusion should be consistent, and translate this to a self-supervised loss function. Our experiments on LINEMOD, Occluded-LINEMOD, YCB and new Randomization LINEMOD dataset evidence the robustness of our approach. We achieve state of the art performance on LINEMOD, and OccludedLINEMOD in without real-pose setting, even outperforming methods that rely on real annotations during training on Occluded-LINEMOD.
연구 동기 및 목표
- 실제 자세 레이블이 가용하지 않을 경우 심한 가림 상태에서 6-DoF 자세 추정의 강인성 부족 문제를 해결하기 위해.
- 레이블이 없는 실재 이미지를 활용하여 실제 환경에서의 일반화 능력을 향상시키는 자기지도 학습 프레임워크를 개발하기 위해.
- 기존의 도메인 랜덤화 전략이 대규모 가림 상태를 처리하지 못하는 한계를 극복하기 위해.
- 실제 가림 조건을 반영한 현실적인 평가 조건에서의 강인성을 평가하기 위해 새로운 벤치마크인 Randomization LINEMOD (Rand-LINEMOD)를 도입하기 위해.
- 실제 자세 레이블이 포함된 학습 데이터에 의존하지 않고도 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 실재 이미지에서 이미지 패치를 제거하여 심한 가림을 시뮬레이션하는 절단 기반 도메인 랜덤화(DR) 전략을 제안한다.
- 원본 실재 이미지와 DR 증강된 버전 간의 일관된 6-DoF 자세 예측을 강제하는 자기지도 학습 손실을 설계한다.
- 원본 이미지와 증강된 이미지를 처리하는 쌍둥이 브랜치 간에 가중치를 공유하는 자기지도 학습 시아모이즈 자세 네트워크(SSPN)를 도입한다.
- 지표가 있는 합성 데이터를 사용해 네트워크를 사전 학습한 후, 레이블이 없는 실재 이미지에서 자기지도 학습 손실을 통해 미세조정한다.
- 합성 DR 데이터와 절단을 통한 증강된 실재 데이터를 조합하여 도메인 간 격차를 줄이고 강인성을 향상시킨다.
- 자세 일치를 강제하기 위해 시아모이즈 아키텍처를 활용하여, 네트워크가 가림에 강인한 표현을 학습할 수 있도록 한다.
실험 결과
연구 질문
- RQ1실제 자세 레이블이 없을 경우 자기지도 학습이 6-DoF 자세 추정의 강인성을 향상시킬 수 있는가?
- RQ2절단 기반 도메인 랜덤화가 심한 가림을 효과적으로 시뮬레이션하고 실제 환경에서의 일반화 능력을 향상시키는가?
- RQ3원본 이미지와 증강된 이미지 간의 자세 일치를 기반으로 한 자기지도 학습 손실이 실제 레이블 없이도 기존 방법을 초월할 수 있는가?
- RQ4실제 자세 레이블에 의존하는 최신 기술 수준의 접근법과 비교해 본다면 제안된 방법은 어떻게 성능을 내는가?
- RQ5새로 도입된 Rand-LINEMOD 데이터셋과 같이 심한 가림 상태를 가진 실제 벤치마크 환경에 일반화 가능한가?
주요 결과
- LINEMOD 데이터셋에서 제안된 방법은 ADD 기준 81.06%의 정확도를 달성하였으며, 기준 모델의 67.6%에 비해 뚜렷한 향상이 있었고, 실제 자세 레이블을 전혀 사용하지 않았다.
- Occluded-LINEMOD 데이터셋에서 방법은 ADD 기준 42.3%의 정확도를 기록하였으며, 이는 이전 최신 기술 수준인 40.8%를 초월했고, 실제 레이블을 사용한 방법들보다도 뛰어났다.
- 실제 자세 레이블이 있는 데이터에 접근할 수 있을 경우, ADD 기준 51.3%의 성능을 기록하여 Occluded-LINEMOD에서 새로운 최신 기술 수준을 수립했다.
- YCB 데이터셋에서 제안된 방법은 모든 지표에서 성능 향상을 보였으며, LINEMOD를 초월한 일반화 능력을 입증했다.
- 절단 DR과 자기지도 학습이 모두 필수적임을 확인한 분석 실험에서, 두 요소의 조합이 가장 큰 성능 향상을 이끌었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.