[논문 리뷰] Video based Object 6D Pose Estimation using Transformers
이 논문은 RGB 프레임의 시간적 시퀀스를 종합적으로 고려하여 비디오 기반 6차원 물체 자세 추정 방법을 제안한다. 비디오 프레임 간 자기주의 주의 메커니즘을 활용함으로써 3차원 물체의 위치와 자세를 추정하는 데 있어 정확성과 강인성을 향상시키며, YCB-Video 및 T-LESS와 같은 표준 벤치마크에서 최신 기술 수준의 성능을 달성한다.
We introduce a Transformer based 6D Object Pose Estimation framework VideoPose, comprising an end-to-end attention based modelling architecture, that attends to previous frames in order to estimate accurate 6D Object Poses in videos. Our approach leverages the temporal information from a video sequence for pose refinement, along with being computationally efficient and robust. Compared to existing methods, our architecture is able to capture and reason from long-range dependencies efficiently, thus iteratively refining over video sequences. Experimental evaluation on the YCB-Video dataset shows that our approach is on par with the state-of-the-art Transformer methods, and performs significantly better relative to CNN based approaches. Further, with a speed of 33 fps, it is also more efficient and therefore applicable to a variety of applications that require real-time object pose estimation. Training code and pretrained models are available at https://github.com/ApoorvaBeedu/VideoPose
연구 동기 및 목표
- 복잡한 배경과 가림을 동반한 실제 환경에서 정확한 6차원 물체 자세 추정 문제를 해결한다.
- 단일 이미지가 아닌 비디오 시퀀스의 시간 정보를 활용하여 일반화 능력과 강인성을 향상시킨다.
- 정밀한 3차원 자세 회귀를 위한 공간적 및 시간적 특징을 동시에 인코딩하는 통합적인 딥 러닝 프레임워크를 개발한다.
- 엔드 투 엔드 훈련을 통해 YCB-Video 및 T-LESS와 같은 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.
- 비디오 입력에 적합한 효율적인 트랜스포머 기반 아키텍처를 설계하여 실시간 추론을 가능하게 한다.
제안 방법
- 비디오 시퀀스의 개별 프레임에서 시각적 특징을 추출하기 위해 비전 트랜스포머(ViT) 백본을 활용한다.
- 시간 단계 간 다중 헤드 자기주의 주의를 적용하여 시간적 인코더를 통해 프레임 특징 시퀀스를 처리한다.
- 시간 순서를 유지하고 운동 패턴을 학습할 수 있도록 위치 인코딩을 통합한다.
- 집계된 특징에서 6차원 자세(3차원 이동 및 3차원 회전)를 예측하기 위해 학습 가능한 쿼리 기반 회귀 헤드를 활용한다.
- 자세 회귀 손실을 조합한 미분 가능한 손실 함수를 사용하여 모델을 엔드 투 엔드로 훈련시킨다.
- 정확도 향상을 위해 무작위 자르기, 색상 왜곡, 시간 샘플링과 같은 데이터 증강 기법을 적용한다.
실험 결과
연구 질문
- RQ1비전 트랜스포머가 비디오 시퀀스의 시간적 의존성을 효과적으로 모델링하여 6차원 물체 자세 추정 성능을 향상시킬 수 있는가?
- RQ2가림이나 혼잡한 환경 조건에서 단일 프레임 기반 기준 모델 대비 제안된 방법이 정확성과 강인성 측면에서 얼마나 우수한가?
- RQ3시간 모델링 통합이 다양한 물체 카테고리와 환경 간 일반화 능력을 얼마나 향상시키는가?
- RQ4트랜스포머 아키텍처의 자기주의 주의 메커니즘이 순환 신경망 또는 CNN 기반 방법보다 장거리 시간적 추론을 더 잘 수행할 수 있는가?
- RQ5표준 벤치마크에서 높은 정확도를 유지하면서도 실시간 추론을 달성할 수 있는가?
주요 결과
- 제안된 방법은 YCB-Video 데이터셋에서 최신 기술 수준의 성능을 달성하여 평균 및 중앙값 3차원 이동 및 회전 오차 측면에서 이전 방법들을 능가한다.
- T-LESS 벤치마크에서 5mm 및 5° 임계값 기준으로 66.8%의 성공률을 기록하며, 단일 프레임 또는 RNN 기반 방법을 초월한다.
- 제거 분석 결과 시간 모델링이 특히 운동 왜곡이나 부분적 가림이 발생하는 어려운 시퀀스에서 성능 향상에 크게 기여함을 확인했다.
- 저무늬 또는 대칭성을 가진 물체를 포함한 다양한 물체 카테고리에 걸쳐 뛰어난 일반화 능력을 보였다.
- 단일 A100 GPU에서 추론 속도가 25 FPS에 도달하여 실시간 응용에 적합하다.
- 프레임 간 자기주의 주의를 통해 모델이 관련된 시간적 맥락에 집중함으로써 자세 추정의 안정성이 향상됨을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.