Skip to main content
QUICK REVIEW

[논문 리뷰] HandAugment: A Simple Data Augmentation Method for Depth-Based 3D Hand Pose Estimation

Zhaohui Zhang, Shipeng Xie|arXiv (Cornell University)|2020. 01. 03.
Human Pose and Action Recognition참고 문헌 23인용 수 16
한 줄 요약

HandAugment는 깊이 맵에서 3D 손 자세 추정을 향상시키기 위해 MANO 기반의 합성 깊이 이미지와 노이즈 증강을 사용하는 데이터 합성 방법을 포함한 이단계 신경망을 제안한다. 실제 데이터와 합성 데이터를 조합함으로써 시점, 관절 움직임, 형태 노이즈를 포함한 다양한 노이즈를 적용하여 기준 모델 대비 27.84%의 오차 감소를 달성했으며, HANDS 2019 챌린지에서 1등을 차지했다.

ABSTRACT

Hand pose estimation from 3D depth images, has been explored widely using various kinds of techniques in the field of computer vision. Though, deep learning based method improve the performance greatly recently, however, this problem still remains unsolved due to lack of large datasets, like ImageNet or effective data synthesis methods. In this paper, we propose HandAugment, a method to synthesize image data to augment the training process of the neural networks. Our method has two main parts: First, We propose a scheme of two-stage neural networks. This scheme can make the neural networks focus on the hand regions and thus to improve the performance. Second, we introduce a simple and effective method to synthesize data by combining real and synthetic image together in the image space. Finally, we show that our method achieves the first place in the task of depth-based 3D hand pose estimation in HANDS 2019 challenge.

연구 동기 및 목표

  • 깊이 기반 3D 손 자세 추정을 위한 대규모이고 다양한 훈련 데이터의 부족 문제를 해결하기 위해.
  • 정확한 자세 추정에 필수적인 깊이 이미지 내 손 영역 국소화를 향상시키기 위해.
  • 노이즈 증강을 통한 데이터 합성으로 실제와 합성 깊이 이미지 간 도메인 갭을 줄이기 위해.
  • 2D CNN 기반 손 자세 추정기의 일반화 능력과 성능을 향상시키는 효과적이고 단순한 데이터 증강 전략을 개발하기 위해.
  • 실세계 깊이 기반 3D 손 자세 추정 작업에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 첫 번째 단계에서 손 영역을 검출하고 두 번째 단계에서 잘라낸 손 영역을 사용해 자세 추정을 정밀화하는 이단계 신경망 아키텍처를 제안한다.
  • 손 모양, 관절 움직임, 카메라 시점의 변화를 제어하여 MANO 손 모델을 사용해 합성 깊이 이미지를 생성한다.
  • 세 가지 데이터 합성 전략을 도입한다: 원본 MANO 파라미터 사용, 실제 데이터와 합성 데이터 혼합, MANO 파라미터에 노이즈 적용(시점, 관절 움직임, 형태).
  • MANO 파라미터에 노이즈를 주입하여 현실적인 변동을 시뮬레이션하고 합성 데이터와 실제 데이터 간 도메인 갭을 줄인다.
  • 두 번째 단계 네트워크를 첫 번째 단계 네트워크에서 미세조정하여 특징 학습과 일반화 능력을 향상시킨다.
  • 훈련 중에 실제 데이터와 증강된 합성 데이터를 결합하여 모델의 강인성과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1이단계 네트워크 아키텍처는 깊이 이미지 내 손 영역 국소화와 그에 이어지는 3D 자세 추정을 향상시키는가?
  • RQ2MANO 모델을 사용한 합성 데이터 생성은 3D 손 자세 추정의 일반화 오차를 줄이는 데 얼마나 효과적인가?
  • RQ3합성 데이터 파라미터(시점, 관절 움직임, 형태)에 노이즈를 추가하면 모델의 강인성과 성능이 얼마나 향상되는가?
  • RQ4실제 데이터와 합성 데이터를 결합하면 실제 데이터만으로 훈련하는 것보다 3D 손 자세 추정에서 성능이 뛰어나지는가?
  • RQ5제안된 데이터 증강 방법은 실세계 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 이단계 네트워크는 기준 모델의 18.93 mm에서 16.50 mm로 오차를 감소시켜 손 영역 국소화 향상을 입증했다.
  • 합성 데이터(SD)를 추가함으로써 오차는 18.93 mm에서 16.74 mm로 감소하여 데이터 증강의 유용성을 보여주었다.
  • 혼합 데이터(MD)와 노이즈가 적용된 데이터(ND)를 통합함으로써 오차는 15.73 mm로 추가로 감소하여 노이즈 증강 합성 데이터의 효과를 입증했다.
  • 두 번째 단계 네트워크의 미세조정은 미세조정 없이 20.99 mm에서 미세조정 후 16.50 mm로 성능 향상을 이끌어내어 그 중요성을 입증했다.
  • 완전한 HandAugment 방법은 기준 모델 대비 27.84% 향상되어 오차를 18.93 mm에서 13.66 mm로 감소시켰다.
  • HandAugment는 HANDS 2019 챌린지의 깊이 기반 3D 손 자세 추정 과제에서 1등을 차지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.