Skip to main content
QUICK REVIEW

[論文レビュー] Gesture Similarity Analysis on Event Data Using a Hybrid Guided Variational Auto Encoder.

Kenneth Stewart, Andreea Danielescu|arXiv (Cornell University)|Mar 31, 2021
Advanced Memory and Neural Computing参考文献 49被引用数 6
ひとこと要約

本論文は、ダイナミックビジョンセンサー(DVS)からのイベントベースのデータを処理するハイブリッドガイド付き変分オートエンコーダー(VAE)を提案し、高時間分解能で空中ジェスチャーを分析することで、自然で疲労のないインタラクションを可能にする。モデルは、ジェスチャー類似度の計算、クラスタリング、神経形状ハードウェア上のオンライン適応に適した分離済み潜在空間を学習する。

ABSTRACT

While commercial mid-air gesture recognition systems have existed for at least a decade, they have not become a widespread method of interacting with machines. This is primarily due to the fact that these systems require rigid, dramatic gestures to be performed for accurate recognition that can be fatiguing and unnatural. The global pandemic has seen a resurgence of interest in touchless interfaces, so new methods that allow for natural mid-air gestural interactions are even more important. To address the limitations of recognition systems, we propose a neuromorphic gesture analysis system which naturally declutters the background and analyzes gestures at high temporal resolution. Our novel model consists of an event-based guided Variational Autoencoder (VAE) which encodes event-based data sensed by a Dynamic Vision Sensor (DVS) into a latent space representation suitable to analyze and compute the similarity of mid-air gesture data. Our results show that the features learned by the VAE provides a similarity measure capable of clustering and pseudo labeling of new gestures. Furthermore, we argue that the resulting event-based encoder and pseudo-labeling system are suitable for implementation in neuromorphic hardware for online adaptation and learning of natural mid-air gestures.

研究の動機と目的

  • 現在の空中ジェスチャー認識システムが要求するきつい、不自然なジェスチャーの制限を解消すること。
  • 高時間分解能でのジェスチャー解析により、ユーザーの疲労を軽減することで、自然でタッチレスのヒューマンマシンインタラクションを実現すること。
  • 学習済み潜在表現を用いて、新しいジェスチャーのクラスタリングと仮ラベル付けが可能なシステムを開発すること。
  • オンライン学習と適応に適した、神経形状ハードウェアへのデプロイに適したモデルを設計すること。

提案手法

  • モデルは、動きの時間的変化を高分解能で捉えるために、ダイナミックビジョンセンサー(DVS)からのイベントベースのデータを入力として使用する。
  • ガイド付き変分オートエンコーダー(VAE)は、ジェスチャー固有の特徴を捉える分離済み潜在空間にイベント系列を符号化するように訓練される。
  • 時間的および空間的事前知識を用いてVAEをガイドすることで、学習された表現の質と解釈可能性が向上する。
  • 潜在空間により、ジェスチャー間の類似度計算が可能となり、未学習のジェスチャーのクラスタリングと仮ラベル付けが支援される。
  • 効率的な推論とオンライン適応に適したアーキテクチャが設計されており、神経形状ハードウェアへのデプロイに適している。
  • イベントベースのデータのスパarsityと効率性を活用することで、計算負荷を低減しながらも高い精度を維持する。

実験結果

リサーチクエスチョン

  • RQ1イベントベースのDVSデータ上で訓練されたVAEは、ジェスチャー類似度分析に適した分離済み潜在表現を効果的に学習できるか?
  • RQ2学習された潜在空間は、未学習の空中ジェスチャーのクラスタリングと仮ラベル付けをどの程度効果的にサポートできるか?
  • RQ3従来のシステムと比較して、本モデルは自然で低負荷のジェスチャーインタラクションをどの程度実現できるか?
  • RQ4提案されたシステムは、リアルタイムでオンライン学習が可能な神経形状ハードウェアに効率的に実装可能か?

主な発見

  • VAEは、イベントベースのDVSデータからジェスチャー固有の特徴を効果的に符号化する分離済み潜在空間を学習する。
  • 学習された表現により、ジェスチャー類似度の正確な計算が可能となり、未学習のジェスチャーの有効なクラスタリングが実現される。
  • 学習された類似度メトリクスを用いて、新しいジェスチャーの信頼性の高い仮ラベル付けが可能になる。
  • アーキテクチャは神経形状ハードウェアへのデプロイに適しており、オンライン適応と低遅延推論を可能にする。
  • きつい、劇的なジェスチャーへの依存が軽減され、より自然で疲労の少ないインタラクションが可能になる。
  • イベントベース処理により、低計算負荷で高時間分解能が実現され、リアルタイム性能が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。