Skip to main content
QUICK REVIEW

[논문 리뷰] RankPose: Learning Generalised Feature with Rank Supervision for Head Pose Estimation

Donggen Dai, Wangkit Wong|arXiv (Cornell University)|2020. 05. 22.
Face recognition and analysis참고 문헌 26인용 수 7
한 줄 요약

RankPose는 RGB 기반의 헤드 포즈 추정을 위한 새로운 딥러닝 접근법을 제안한다. 이는 코사인 및 arcoss 변환을 이용해 유한한 각도 공간으로 포즈 예측을 재구성하고, 신원과 조명에 관계없이 일반화된 포즈 특징을 학습하기 위해 순서 기반 손실을 갖춘 시아모닉 네트워크를 도입한다. 이 방법은 최신 기술 수준(SOTA)을 초월하여 AFLW2000에서 MAE 3.66, BIWI에서 3.71을 기록하며, 이는 이전 SOTA 대비 각각 18.66%와 7.25% 향상된 성능이다.

ABSTRACT

We address the challenging problem of RGB image-based head pose estimation. We first reformulate head pose representation learning to constrain it to a bounded space. Head pose represented as vector projection or vector angles shows helpful to improving performance. Further, a ranking loss combined with MSE regression loss is proposed. The ranking loss supervises a neural network with paired samples of the same person and penalises incorrect ordering of pose prediction. Analysis on this new loss function suggests it contributes to a better local feature extractor, where features are generalised to Abstract Landmarks which are pose-related features instead of pose-irrelevant information such as identity, age, and lighting. Extensive experiments show that our method significantly outperforms the current state-of-the-art schemes on public datasets: AFLW2000 and BIWI. Our model achieves significant improvements over previous SOTA MAE on AFLW2000 and BIWI from 4.50 to 3.66 and from 4.0 to 3.71 respectively. Source code will be made available at: https://github.com/seathiefwang/RankHeadPose.

연구 동기 및 목표

  • 신원, 조명, 표정 변화로 인해 성능이 제한되는 2D RGB 이미지 내 헤드 포즈 추정 문제를 해결하기 위해.
  • 신원과 조명과 같은 포즈와 관련 없는 요소에 영향을 받지 않는 포즈 관련 특징을 학습함으로써 특징 일반화를 향상시키기 위해.
  • 동일한 사람의 이미지 쌍에 대해 예측된 각도의 상대적 순서가 올바르게 유지되도록 보장함으로써 국소적 특징 학습을 향상시키는 손실 함수를 개발하기 위해.
  • 기하학적 변환과 순서 기반 감독을 조합하여 공개 벤치마크에서 최신 기술 수준 성능을 달성하기 위해.

제안 방법

  • 딥 페처와 출력 가중치에 L2 정규화를 적용하여 헤드 포즈 예측을 재구성하고, arccos를 통해 코사인 유사도 기반 각도 추정으로 변환한다.
  • 동일한 사람의 이미지 쌍을 처리하기 위해 시아모닉 네트워크 아키텍처를 사용하여 유사한 전반적 조건 하에서 포즈 예측을 비교할 수 있도록 한다.
  • 동일한 사람의 이미지 쌍 간에 예측 각도의 순서가 잘못되었을 경우에 이를 보상하는 순서 기반 손실을 도입하여, 모델이 포즈 관련 특징을 우선적으로 학습하도록 유도한다.
  • 순서 기반 손실과 MSE 회귀 손실을 조합하여 정확도와 상대적 포즈 순서 유지 양면에서 공동 최적화를 수행한다.
  • 코사인 유사도 출력을 실제 올리어 각도로 매핑하기 위해 arccos 변환을 적용하여 제한된 범위이자 기하학적으로 의미 있는 예측을 보장한다.
  • 대조적 감독을 통해 엔드 투 엔드로 학습함으로써 신원과 조명에 영향을 받지 않는 포즈 특화 특징(추상적 랜드마크)을 학습한다.

실험 결과

연구 질문

  • RQ1코사인 및 arcoss 연산을 통해 헤드 포즈 예측을 유한한 각도 공간으로 변환하면 회귀 정확도가 향상되는가?
  • RQ2동일한 사람의 이미지 쌍을 비교하는 순서 기반 손실이 조명과 신원과 같은 포즈와 관련 없는 변동에 대한 모델의 일반화 능력을 향상시키는가?
  • RQ3arccos 변환과 순서 기반 손실의 조합이 포즈 추정을 위한 국소적 특징 학습에 더 나은 성능을 제공하는가?
  • RQ4제안된 방법이 AFLW2000과 BIWI와 같은 표준 벤치마크에서 기존 최신 기술 수준(SOTA) 방법보다 얼마나 뛰어나게 성능을 냈는가?

주요 결과

  • RankPose는 AFLW2000에서 MAE를 기존 SOTA의 4.50에서 3.66으로 감소시켜 18.66% 향상시켰다.
  • BIWI 데이터셋에서는 MAE를 기존 SOTA의 4.00에서 3.71로 개선하여 상대적 감소율이 7.25%였다.
  • 오차 분포 분석 결과, 98.7%의 양측 예측이 15° 이내에 위치하고, 피치의 97.25%와 롤의 97.15%가 20° 이내에 위치하여 강력한 내성성을 보였다.
  • 제거 실험 결과, MSE와 함께 순서 기반 손실을 사용할 경우 항상 MSE 단독 사용보다 우수했으며, arccos 변환 적용 시 최고의 성능을 기록했다.
  • 모든 각도(Yaw, Pitch, Roll)에서 랜드마크 기반 및 랜드마크 없는 기존 SOTA 방법 대비 일관된 성능 향상을 보였다.
  • 특히 신원과 조명이 다양하게 변하는 도전적인 조건에서도 뛰어난 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.