Skip to main content
QUICK REVIEW

[논문 리뷰] OMAD: Object Model with Articulated Deformations for Pose Estimation and Retrieval

Xue Han, Liu Liu|arXiv (Cornell University)|2021. 12. 14.
Multimodal Machine Learning Applications인용 수 10
한 줄 요약

이 논문은 체계적이고 파arametric한 모델인 OMAD를 제안한다. OMAD는 기하학적 변형과 자세 변형을 동시에 포괄하는 카테고리 특화 파라미터 모델로, 형태 매개변수 β와 관절 상태 θ를 명시적으로 표현한다. OMADNet은 딥러닝 기반 파ip라인으로 단일 시야 관측에서 이러한 매개변수를 예측하며, 새로운 합성 데이터셋에서 카테고리 수준의 자세 추정 및 82.3% mAP를 기록한 상태최고 성능을 달성한다.

ABSTRACT

Articulated objects are pervasive in daily life. However, due to the intrinsic high-DoF structure, the joint states of the articulated objects are hard to be estimated. To model articulated objects, two kinds of shape deformations namely the geometric and the pose deformation should be considered. In this work, we present a novel category-specific parametric representation called Object Model with Articulated Deformations (OMAD) to explicitly model the articulated objects. In OMAD, a category is associated with a linear shape function with shared shape basis and a non-linear joint function. Both functions can be learned from a large-scale object model dataset and fixed as category-specific priors. Then we propose an OMADNet to predict the shape parameters and the joint states from an object's single observation. With the full representation of the object shape and joint states, we can address several tasks including category-level object pose estimation and the articulated object retrieval. To evaluate these tasks, we create a synthetic dataset based on PartNet-Mobility. Extensive experiments show that our simple OMADNet can serve as a strong baseline for both tasks.

연구 동기 및 목표

  • 단일 시야 관측(예: 깊이 이미지 또는 포인트 클라우드)으로부터 고자유도도의 체계적 물체를 모델링하는 데 도전하는 것.
  • 통합된, 카테고리 특화된 표현에서 기하학적 변형과 자세 변형을 명시적으로 모델링하는 것.
  • 자세 추정 및 검색과 같은 후속 작업을 위한 형태 매개변수와 관절 상태를 예측하는 딥러닝 프레임워크를 개발하는 것.
  • 다양한 자세와 가림을 고려한 체계적 물체 모델링 평가를 위한 대규모 합성 데이터셋을 구축하는 것.
  • 통합된 파arametric한 물체 모델을 사용하여 카테고리 수준의 자세 추정 및 검색에 강력한 베이스라인을 설정하는 것.

제안 방법

  • OMAD는 형태 매개변수 β와 관절 상태 θ를 사용하여 체계적 물체를 표현하며, 기준 공간 표현 P′ 및 Φ′을 선형 형태 함수와 비선형 관절 함수로부터 유도한다.
  • 형태 함수 P′ = S(β; B)는 기능에 특화된 형태 기저 B를 사용하여 기하학적 변형을 모델링하고, 관절 함수 Φ′ = J(β; Γ)는 기능에 특화된 매개변수 Γ를 사용하여 관절 구성 상태를 모델링한다.
  • 변형 함수 W(P′, Φ′, θ)는 기준 구조를 카메라 공간으로 매핑하여 β와 θ로부터 완전한 3D 재구성을 가능하게 한다.
  • OMADNet은 코arse 예측 단계와 최적화 보정 단계를 갖는 신경망을 사용하여 단일 관측에서 β와 θ를 회귀한다.
  • 정점 예측 브랜치에 주의 메커니즘을 통합하여 국소화 정확도와 의미 일관성을 향상시킨다.
  • 논문은 PartNet-Mobility에서 유래한 합성 데이터셋인 ArtImage를 활용하여 자세 추정 및 검색 작업에서 모델을 훈련 및 평가한다.

실험 결과

연구 질문

  • RQ1통합된 파arametric 표현은 카테고리 수준에서 체계적 물체의 기하학적 변형과 자세 변형을 효과적으로 모델링할 수 있는가?
  • RQ2딥 뉴럴 네트워크는 단일 시야 관측에서 형태 매개변수와 관절 상태를 높은 정확도로 예측할 수 있는가?
  • RQ3예측된 형태 매개변수는 체계적 물체 검색을 위한 강력하고 자세에 영향을 받지 않는 서명으로 기능하는가?
  • RQ4제안된 OMAD 표현은 기존 방법에 비해 카테고리 수준의 자세 추정 및 검색에서 어떻게 비교되는가?
  • RQ5정점 감독 및 주의 메커니즘의 통합은 OMADNet 파이프라인 성능에 어떤 영향을 미치는가?

주요 결과

  • 랩탑 카테고리에서 OMADNet은 관절 상태 오차 1.1° 및 관절 거리 오차 0.01을 기록하며, 기준 방법들을 크게 능가한다.
  • 안경 카테고리에서는 두 관절에 대해 각각 1.1° 및 1.2°의 관절 상태 오차를 기록하여 복잡한 변형 조건에서도 높은 정확도를 확보한다.
  • 다섯 카테고리에 걸쳐 체계적 물체 검색 작업에서 평균 mAP 82.3%를 달성하여 시amese 네트워크 기준 방법을 능가한다.
  • 제거 분석 결과, 최적화 단계에서 진짜 정점 정보를 사용할 경우 서랍 카테고리의 관절 상태 오차가 0.001°로 감소하여, 정점 예측이 현재의 성능 저하 요인임을 확인한다.
  • t-SNE 시각화 결과 예측된 형태 매개변수가 자세에 영향을 받지 않으며 서로 다른 인스턴스 간에 잘 분리되어 있음을 확인하여, 검색 서명으로서의 효과성을 검증한다.
  • 정점 브랜치에 주의 점수를 통합함으로써 모든 메트릭에서 성능 향상이 관찰되어, 국소화 정확도 향상에 기여하는 역할을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.