Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Realistic Training Images Based on Tonality-Alignment Generative Adversarial Networks for Hand Pose Estimation

Liangjian Chen, Shih-Yao Lin|arXiv (Cornell University)|2018. 11. 25.
Human Pose and Action Recognition참고 문헌 45인용 수 16
한 줄 요약

이 논문은 인공지능 기반의 실시간 시뮬레이터에서 생성한 합성 손 자세 이미지와 실제 배경을 융합하여 현실감 있는 손 자세 이미지를 합성하는 톤얼라인먼트 생성 적대 신경망(TAGAN)을 제안한다. 이는 색채와 톤 분포를 정렬함으로써 훈련 데이터의 품질을 향상시키며, 최신 기준 대비 2D 및 3D 손 자세 추정 성능을 크게 향상시킨다.

ABSTRACT

Hand pose estimation from a monocular RGB image is an important but challenging task. The main factor affecting its performance is the lack of a sufficiently large training dataset with accurate hand-keypoint annotations. In this work, we circumvent this problem by proposing an effective method for generating realistic hand poses and show that state-of-the-art algorithms for hand pose estimation can be greatly improved by utilizing the generated hand poses as training data. Specifically, we first adopt an augmented reality (AR) simulator to synthesize hand poses with accurate hand-keypoint labels. Although the synthetic hand poses come with precise joint labels, eliminating the need of manual annotations, they look unnatural and are not the ideal training data. To produce more realistic hand poses, we propose to blend a synthetic hand pose with a real background, such as arms and sleeves. To this end, we develop tonality-alignment generative adversarial networks (TAGANs), which align the tonality and color distributions between synthetic hand poses and real backgrounds, and can generate high quality hand poses. We evaluate TAGAN on three benchmarks, including the RHP, STB, and CMU-PS hand pose datasets. With the aid of the synthesized poses, our method performs favorably against the state-of-the-arts in both 2D and 3D hand pose estimations.

연구 동기 및 목표

  • 딥 러닝 모델을 훈련하기 위한 정확한 3D 관절 라벨가 있는 대규모이고 현실적인 손 자세 데이터셋의 부족을 해결하기 위해.
  • 일반적으로 인위적으로 보이는 인공지능 기반 시뮬레이터에서 생성된 합성 손 자세 이미지의 현실감을 향상시켜 모델의 일반화 능력을 떨어뜨리는 문제를 해결하기 위해.
  • 형태와 톤 분포를 유지하면서 합성 손 자세를 실제 배경에 자연스럽게 융합할 수 있는 조건부 GAN 기반의 방법을 개발하기 위해.
  • TAGAN으로 생성된 이미지를 활용해 훈련된 손 자세 추정 모델이 벤치마크 데이터셋에서 최신 기준 대비 뛰어난 성능을 보임을 입증하기 위해.
  • 구조적 변경 없이도 기존의 자세 추정 모델을 향상시킬 수 있는 확장 가능한 데이터 증강 솔루션을 제공하기 위해.

제안 방법

  • 증강현실(AR) 시뮬레이터를 사용하여 정확한 3D 관절 라벨가 있는 대규모 손 자세 이미지를 생성한다.
  • 각 합성 손 자세를 실제 배경 이미지와 융합하여 복합 훈련 샘플을 생성한다.
  • 형태와 톤 정렬 조건을 갖춘 조건부 GAN인 톤얼라인먼트 생성 적대 신경망(TAGAN)을 제안한다.
  • 입력 이미지와 생성된 이미지 간의 색채 분포와 밝기(루미넌스)를 정렬함으로써 시각적 결함을 줄이기 위한 톤 정렬 손실을 도입한다.
  • 이미지 번역 과정에서 정확한 손 자세의 구조를 유지하기 위해 형태 특징을 조건부 입력으로 사용한다.
  • 고해상도의 현실적인 손 이미지를 생성할 수 있도록 GAN을 종합적으로 훈련시켜 실제 이미지와 시각적으로 구분되지 않도록 한다.

실험 결과

연구 질문

  • RQ1합성 손 자세를 실제 배경과 융합함으로써 손 자세 추정을 위한 훈련 데이터의 현실감을 향상시킬 수 있는가?
  • RQ2조건부 GAN 모델이 합성 손과 실제 배경 간의 톤 및 색채 분포를 효과적으로 정렬하여 도메인 갭을 줄일 수 있는가?
  • RQ3TAGAN으로 생성된 이미지를 활용해 훈련된 2D 및 3D 손 자세 추정 모델이 기준 모델 대비 측정 가능한 성능 향상을 이룰 수 있는가?
  • RQ4TAGAN으로 생성된 데이터로 훈련된 손 자세 추정 모델의 성능은 실제 데이터 또는 순수 합성 데이터로 훈련된 모델과 비교해 어떻게 다른가?
  • RQ5톤 정렬이 합성된 손 이미지의 현실감과 일반화 능력 향상에 얼마나 기여하는가?

주요 결과

  • TAGAN으로 생성된 데이터로 3D 손 자세 추정 모델을 훈련한 결과, RHP 데이터셋에서 3D 자세 추정의 평균 오차(EPE)가 11.4mm 감소했고, STB 데이터셋에서는 8.7mm 감소했다.
  • 2D 자세 추정의 경우, RHP 데이터셋에서 EPE 오차가 0.98 픽셀 감소했고, STB 데이터셋에서는 0.06 픽셀 감소했다.
  • CMU-PS 데이터셋에서 CPM 모델의 PCK@20 정확도는 TAGAN으로 생성된 데이터로 훈련한 결과 24.09에서 28.81로 상승하여 일반화 능력 향상이 뚜렷하게 확인되었다.
  • CPM 모델의 EPE 평균 오차는 TAGAN으로 증강된 데이터를 사용했을 때 55.99mm에서 52.93mm로 감소하여 회귀 정확도 향상을 확인했다.
  • TAGAN으로 생성된 데이터는 순수 AR 시뮬레이터로 생성된 합성 손 이미지와 실제 배경과 융합된 AR+RBG 데이터보다 우수한 성능를 보이며, 톤 정렬의 효과성을 입증했다.
  • STB 및 RHP 데이터셋 모두에서, TAGAN으로 증강된 데이터로 훈련된 Hand3D 모델은 Z&B 및 Mueller 등과 같은 기존 방법들을 뛰어넘는 최신 기준 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.