Skip to main content
QUICK REVIEW

[논문 리뷰] Gesture Similarity Analysis on Event Data Using a Hybrid Guided Variational Auto Encoder.

Kenneth Stewart, Andreea Danielescu|arXiv (Cornell University)|2021. 03. 31.
Advanced Memory and Neural Computing참고 문헌 49인용 수 6
한 줄 요약

이 논문은 동적 시각 센서(DVS)에서 생성되는 이벤트 기반 데이터를 처리하여 고시간 해상도로 공중 제스처를 분석하는 하이브리드 가이드 VAE를 제안한다. 이는 자연스럽고 피로감이 없는 상호작용을 가능하게 한다. 모델은 정확한 제스처 유사도 계산, 클러스터링, 뉴모르픽 하드웨어에서의 온라인 적응을 위한 의사 레이블링을 지원하는 분리된 잠재 공간을 학습한다.

ABSTRACT

While commercial mid-air gesture recognition systems have existed for at least a decade, they have not become a widespread method of interacting with machines. This is primarily due to the fact that these systems require rigid, dramatic gestures to be performed for accurate recognition that can be fatiguing and unnatural. The global pandemic has seen a resurgence of interest in touchless interfaces, so new methods that allow for natural mid-air gestural interactions are even more important. To address the limitations of recognition systems, we propose a neuromorphic gesture analysis system which naturally declutters the background and analyzes gestures at high temporal resolution. Our novel model consists of an event-based guided Variational Autoencoder (VAE) which encodes event-based data sensed by a Dynamic Vision Sensor (DVS) into a latent space representation suitable to analyze and compute the similarity of mid-air gesture data. Our results show that the features learned by the VAE provides a similarity measure capable of clustering and pseudo labeling of new gestures. Furthermore, we argue that the resulting event-based encoder and pseudo-labeling system are suitable for implementation in neuromorphic hardware for online adaptation and learning of natural mid-air gestures.

연구 동기 및 목표

  • 현재의 공중 제스처 인식 시스템이 강제적이고 비자연스러운 제스처를 요구하는 한계를 해결하기 위해.
  • 고시간 해상도의 제스처 분석을 통해 사용자 피로를 줄이고 자연스럽고 터치리스의 인간-기계 상호작용을 가능하게 하기 위해.
  • 학습된 잠재 표현을 사용하여 새로운 제스처의 클러스터링과 의사 레이블링을 수행할 수 있는 시스템을 개발하기 위해.
  • 온라인 학습과 적응을 위한 뉴모르픽 하드웨어에 적합한 모델을 설계하기 위해.

제안 방법

  • 모델은 동적 시각 센서(DVS)에서 유래한 이벤트 기반 데이터를 입력으로 사용하여 운동의 시간적 변화를 고해상도로 캡처한다.
  • 가이드된 변분 오토인코더(VAE)는 제스처 특성에 초점을 맞춘 분리된 잠재 공간으로 이벤트 시퀀스를 인코딩하도록 훈련된다.
  • 시간적 및 공간적 사전 지식을 활용하여 학습된 표현의 품질과 해석 가능성을 향상시킨다.
  • 잠재 공간은 제스처 간의 유사도 계산을 가능하게 하여, 새로운 제스처의 클러스터링과 의사 레이블링을 지원한다.
  • 효율적인 추론과 온라인 적응을 고려하여 설계된 아키텍처로, 뉴모르픽 하드웨어 배포에 적합하다.
  • 이벤트 기반 데이터의 희소성과 효율성을 활용하여 계산 부하를 줄이면서도 높은 정확도를 유지한다.

실험 결과

연구 질문

  • RQ1이벤트 기반 DVS 데이터를 기반으로 훈련된 VAE가 제스처 유사도 분석에 적합한 분리된 잠재 표현을 효과적으로 학습할 수 있는가?
  • RQ2학습된 잠재 공간이 새로운 공중 제스처의 클러스터링과 의사 레이블링을 얼마나 잘 지원하는가?
  • RQ3기존 시스템과 비교해 볼 때, 이 모델이 자연스럽고 부담감이 적은 제스처 상호작용을 얼마나 잘 실현하는가?
  • RQ4제안된 시스템이 실시간 온라인 학습을 위해 뉴모르픽 하드웨어에 효율적으로 구현될 수 있는가?

주요 결과

  • VAE는 이벤트 기반 DVS 데이터로부터 제스처 특성에 초점을 맞춘 효과적인 분리된 잠재 공간을 학습한다.
  • 학습된 표현은 정확한 제스처 유사도 계산을 가능하게 하여, 새로운 제스처의 효과적인 클러스터링을 지원한다.
  • 학습된 유사도 메트릭을 활용하여 새로운 제스처에 대한 신뢰성 있는 의사 레이블링을 달성한다.
  • 아키텍처는 뉴모르픽 하드웨어에 배포하기에 적합하여 온라인 적응과 저지연 추론을 가능하게 한다.
  • 강제적이고 극단적인 제스처에 대한 의존도를 줄여 자연스럽고 피로감이 적은 상호작용을 지원한다.
  • 이벤트 기반 처리 방식은 낮은 계산 부하로도 고시간 해상도를 확보하여 실시간 성능을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.