Skip to main content
QUICK REVIEW

[논문 리뷰] A Vector-based Representation to Enhance Head Pose Estimation

Zhiwen Cao, Zongcheng Chu|arXiv (Cornell University)|2020. 10. 14.
Face recognition and analysis참고 문헌 41인용 수 4
한 줄 요약

이 논문은 헤드 포즈를 표현하기 위해 세 개의 정규직교 벡터(왼쪽, 아래, 앞)를 사용하는 벡터 기반 표현 방식을 제안하여 오일러 각도와 퀼레르니언의 불연속성 문제를 해결한다. 새로운 손실 함수인 벡터의 평균 절대 오차(MAEV)와 정규직교 조건을 갖춘 신경망(트라이넷)을 도입하여 AFLW2000 및 BIWI 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 특히 측면 시각에서 오차가 크게 감소하였다.

ABSTRACT

This paper proposes to use the three vectors in a rotation matrix as the representation in head pose estimation and develops a new neural network based on the characteristic of such representation. We address two potential issues existed in current head pose estimation works: 1. Public datasets for head pose estimation use either Euler angles or quaternions to annotate data samples. However, both of these annotations have the issue of discontinuity and thus could result in some performance issues in neural network training. 2. Most research works report Mean Absolute Error (MAE) of Euler angles as the measurement of performance. We show that MAE may not reflect the actual behavior especially for the cases of profile views. To solve these two problems, we propose a new annotation method which uses three vectors to describe head poses and a new measurement Mean Absolute Error of Vectors (MAEV) to assess the performance. We also train a new neural network to predict the three vectors with the constraints of orthogonality. Our proposed method achieves state-of-the-art results on both AFLW2000 and BIWI datasets. Experiments show our vector-based annotation method can effectively reduce prediction errors for large pose angles.

연구 동기 및 목표

  • 헤드 포즈 추정에서 사용되는 오일러 각도와 퀼레르니언 표기법의 불연속성 문제를 해결하기 위해.
  • 큰 포즈 각도에서 실제 포즈 추정 성능을 더 잘 반영하는 새로운 평가 지표인 MAEV(벡터의 평균 절대 오차)를 제안하기 위해.
  • 정규직교 벡터 세 개를 예측하는 딥 신경망(트라이넷)을 개발하여 헤드 포즈를 표현하기 위해 수직 조건을 강제하기 위해.
  • 기존 오일러 각도 기반 방법이 기구자이드 락(기구자이드 락)과 레이블 불연속성으로 실패하는 측면 시각에서의 성능 향상하기 위해.

제안 방법

  • 회전 행렬에서 유도된 세 개의 정규직교 벡터(왼쪽(빨강), 아래(초록), 앞(파랑))를 사용해 헤드 포즈를 표현하기.
  • 정규직교 조건을 강제하기 위해 미분 가능한 손실 제약을 적용한 CNN 기반 네트워크(트라이넷)를 학습하여 이들 세 벡터를 직접 예측하기.
  • 예측된 벡터와 진짜 값 간의 각도 차이를 기반으로 한 새로운 손실 함수를 도입하여 MAEV 지표를 구성하기.
  • 캡슐 네트워크 출력층에서 균일 샘플링을 적용하여 특징 표현과 예측 정확도 향상시키기.
  • 300W-LP를 학습 데이터셋으로 사용하고, AFLW2000 및 BIWI 데이터셋에서 MAE와 MAEV 지표를 모두 사용하여 평가하기.
  • 학습 중에 예측된 벡터가 정규직교 상태를 유지하도록 미분 가능한 정규직교 제약 손실을 적용하기.

실험 결과

연구 질문

  • RQ1벡터 기반의 헤드 포즈 표현 방식이 오일러 각도와 퀼레르니언에서 발생하는 불연속성 문제를 줄일 수 있는가?
  • RQ2제안된 MAEV 지표가 기존 오일러 각도의 MAE보다 헤드 포즈 추정 성능을 더 정확하고 신뢰성 있게 평가할 수 있는가?
  • RQ3세 개의 정규직교 벡터를 예측하도록 학습된 딥 신경망이 큰 포즈 각도, 특히 측면 시각에서 더 높은 성능을 낼 수 있는가?
  • RQ4정규직교 제약과 벡터 기반 손실 함수의 통합이 헤드 포즈 추정의 일반화 능력과 강인성 향상에 기여하는가?

주요 결과

  • 제안된 벡터 기반 표기 방식은 오일러 각도가 큰 레이블 차이를 보이는 것과 달리, 유사한 포즈(예: 측면 시각)에 대해 일관된 표현을 제공한다.
  • MAEV 지표는 더 정확한 성능 측정을 가능하게 하며, 측면 이미지의 예측 오차가 단지 2.249°로 나타나고, 오일러 각도의 MAE는 잘못된 44.2°로 나타나는 데 비해 더욱 신뢰할 수 있다.
  • BIWI 데이터셋에서 트라이넷은 MAE 4.23°와 MAEV 2.81°를 기록하여 모든 기준 모델을 압도하는 최고의 성능을 달성하였다.
  • 오차 분석 결과, MAEV는 포즈 각도가 증가함에 따라 MAE만큼 빠르게 증가하지 않으며, 이는 MAE가 큰 포즈 추정에 부적절함을 확인한다.
  • 제거 분석 결과, 특징 매핑, 캡슐 모듈, 정규직교 손실을 모두 조합할 경우 최고의 성능을 기록하였으며, 캡슐 레이어에서의 비균일 샘플링 또한 성능 향상에 기여하였다.
  • 이 방법은 측면 시각에서의 예측 오차를 크게 감소시켰으며, FSA-Net과 Hopenet는 임의의 결과를 내는 반면, 트라이넷은 높은 정확도를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.