Skip to main content
QUICK REVIEW

[논문 리뷰] Synthetic Video Generation for Robust Hand Gesture Recognition in Augmented Reality Applications

Varun Jain, Shivam Aggarwal|arXiv (Cornell University)|2019. 11. 04.
Human Pose and Action Recognition참고 문헌 9인용 수 5
한 줄 요약

이 논문은 깊이 센서 없이 AR/VR 환경에서 강인한 손가락 제스처 인식을 가능하게 하기 위해, CycleGAN과 전경-배경 장면 조합 기법을 활용한 GAN 기반 프레임워크를 제안한다. 이는 정확한 손가락 제스처 애너테이션을 갖춘 사진처럼 생긴 합성 이고세트릭 비디오를 생성한다. 이 방법은 다양한 배경과 일관된 손끝 정렬을 갖춘 고해상도 비디오를 생성하여 고비용의 실세계 데이터 수집에 크게 의존하지 않게 한다.

ABSTRACT

Hand gestures are a natural means of interaction in Augmented Reality and Virtual Reality (AR/VR) applications. Recently, there has been an increased focus on removing the dependence of accurate hand gesture recognition on complex sensor setup found in expensive proprietary devices such as the Microsoft HoloLens, Daqri and Meta Glasses. Most such solutions either rely on multi-modal sensor data or deep neural networks that can benefit greatly from abundance of labelled data. Datasets are an integral part of any deep learning based research. They have been the principal reason for the substantial progress in this field, both, in terms of providing enough data for the training of these models, and, for benchmarking competing algorithms. However, it is becoming increasingly difficult to generate enough labelled data for complex tasks such as hand gesture recognition. The goal of this work is to introduce a framework capable of generating photo-realistic videos that have labelled hand bounding box and fingertip that can help in designing, training, and benchmarking models for hand-gesture recognition in AR/VR applications. We demonstrate the efficacy of our framework in generating videos with diverse backgrounds.

연구 동기 및 목표

  • AR/VR 애플리케이션에서 손 제스처 인식을 위한 대규모, 다양한 배경, 완전한 애너테이션을 갖춘 실세계 데이터셋의 부족 문제를 해결하기 위해.
  • 조명, 배경, 손 자세의 다양성을 모방하는 합성 데이터를 통해 고비용의 깊이 센서 및 다중 카메라 설정에 대한 의존도를 줄이기 위해.
  • 시간적으로 일관된, 사진처럼 생긴 비디오를 정확한 손 바운딩 박스와 손끝 애너테이션을 갖추어 생성하는 스케일러블하고 종단 간 엔드 투 엔드 비디오 생성 파이프라인을 개발하기 위해.
  • 실세계 데이터 증강 및 적대적 훈련을 통합하여 합성 데이터와 실세계 데이터 간의 도메인 슬립을 완화하기 위해.
  • 합성 데이터를 통해 RGB 전용 손 제스처 인식을 위한 간단하고 일반화 능력이 뛰어난 딥 러닝 모델을 훈련시킬 수 있도록 하기 위해.

제안 방법

  • 프레임워크는 손과 손끝의 외관을 서로 다른 배경 도메인 간에 전환하면서도 공간 일관성을 유지하는 CycleGAN 기반의 이미지 간 전이 네트워크를 사용한다.
  • 전경 생성은 Turkoglu 등이 제안한 사전 훈련된 모델을 활용하여 일관된 기하학적 형태와 피부 톤을 갖춘 손 마스크를 추출하고 재배치한다.
  • 시퀀셜 장면 생성 과정은 제스처에 특화된 마스크에 의해 유도되는 애핀 변환을 사용하여 전경 손을 다양한 배경 이미지에 복합한다.
  • 생성자는 국소적 현실감을 강화하기 위해 PatchGAN 판별기를 활용하여 아티팩트를 줄이고 프레임의 시각적 정교함을 향상시킨다.
  • 피부 색상의 세그먼테이션은 HSV 공간에서 수행되며, GrabCut 기반 전경 추출을 통해 손 영역을 정확하게 분리한다.
  • 방향 기반 애핀 변환을 마스크에 적용함으로써 시스템은 시간적 생성을 지원하여 원형 포인터와 같은 동적 제스처 시퀀스를 생성할 수 있다.

실험 결과

연구 질문

  • RQ1GAN 기반 프레임워크는 정확한 손 및 손끝 애너테이션을 갖춘 사진처럼 생긴 다양하고 시간적으로 일관된 이고세트릭 비디오를 생성할 수 있는가?
  • RQ2이 방법으로 생성된 합성 데이터가 RGB 기반 손 제스처 인식 모델의 일반화 능력 향상에 얼마나 기여하는가?
  • RQ3단일 기준 마스크와 공간 변환을 사용하여 복잡한 제스처 시퀀스(예: 원형 포인터)를 생성할 수 있는가?
  • RQ4시각적 정교도와 아티팩트 억제 측면에서 기존 표준 CycleGAN 대비 합성 비디오의 품질은 어떻게 비교되는가?
  • RQ5훈련 과정에서 소수의 실세계 샘플을 포함시킴으로써 합성 데이터와 실세계 데이터 간의 도메인 갭을 더 줄일 수 있는가?

주요 결과

  • 프레임워크는 코브 스톤 포장에서 테니스 코트까지 매우 다를 수 있는 도메인 간 전이에서도 최소한의 시각적 아티팩트로 사진처럼 생긴 비디오를 성공적으로 생성한다.
  • 합성 이미지들은 모든 프레임에서 일관된 손과 손끝 정렬을 유지하며, 눈에 띄는 왜곡이나 이질성이 없다.
  • 다양한 배경에서 피부 톤의 색상 일관성 등 세부 사항을 더 잘 유지하고 색상 불일치를 줄이는 데 있어 표준 CycleGAN보다 성능이 뛰어나다.
  • 단일 마스크에 방향 기반 애핀 변환을 적용하여 원형 포인터와 같은 일관된 제스처 시퀀스를 생성함으로써 시간적 일관성을 입증하였다.
  • 소수의 실세계 샘플을 포함한 합성 데이터로 훈련하면 도메인 슬립이 크게 줄어들며 모델의 일반화 능력이 향상된다.
  • 이 방법은 대규모로 완전히 애너테이션된 비디오 데이터셋을 생성할 수 있으며, 이를 통해 깊이 센서 없이도 강인한 손 제스처 인식 모델을 훈련시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.