Skip to main content
QUICK REVIEW

[論文レビュー] Learning to recognize touch gestures: recurrent vs. convolutional features and dynamic sampling

Quentin Debard, Christian Wolf|arXiv (Cornell University)|Feb 19, 2018
Hand Gesture Recognition Systems参考文献 33被引用数 15
ひとこと要約

本稿では、可変長のタッチシーケンスを固定長のトポロジーを保つ表現に変換する動的サンプリングを用いた深層学習手法を提案し、1次元畳み込みニューラルネットワーク(CNN)で分類する。このアプローチは、再帰型モデルや最先端手法を上回り、MMGデータセットで99.38%の精度を達成し、1人を除いた交差検証評価では98.62%の精度を示した。

ABSTRACT

We propose a fully automatic method for learning gestures on big touch devices in a potentially multi-user context. The goal is to learn general models capable of adapting to different gestures, user styles and hardware variations (e.g. device sizes, sampling frequencies and regularities). Based on deep neural networks, our method features a novel dynamic sampling and temporal normalization component, transforming variable length gestures into fixed length representations while preserving finger/surface contact transitions, that is, the topology of the signal. This sequential representation is then processed with a convolutional model capable, unlike recurrent networks, of learning hierarchical representations with different levels of abstraction. To demonstrate the interest of the proposed method, we introduce a new touch gestures dataset with 6591 gestures performed by 27 people, which is, up to our knowledge, the first of its kind: a publicly available multi-touch gesture dataset for interaction. We also tested our method on a standard dataset of symbolic touch gesture recognition, the MMG dataset, outperforming the state of the art and reporting close to perfect performance.

研究の動機と目的

  • 多様なユーザーのスタイル、デバイスの違い、マルチユーザー環境に対応できる完全自動のジェスチャー認識システムの開発。
  • サンプリング周波数やハードウェア構成にばらつきがある可変長のタッチシーケンスの課題に対処すること。
  • 事前に定義されたジェスチャー規約の必要性を排除し、生のタッチデータから学習することでユーザーの負担を軽減すること。
  • 効率的なモデル設計と入力処理により、リアルタイム推論を可能にすること。
  • インタラクションベースのジェスチャーをカバーする、新しい公開可能なマルチタッチジェスチャーデータセットの提供により、既存のベンチマークの空白を埋めること。

提案手法

  • 入力シーケンスを固定長の表現に再サンプリングする新規な動的サンプリング技術を導入し、特に指の接触・離脱などの急峻な遷移を保持する。
  • 時間的正規化を適用して長さの異なるシーケンスを整列させつつ、タッチイベントのトポロジカル構造を維持する。
  • 固定長入力を用いて1次元畳み込みニューラルネットワーク(CNN)が、階層的な空間的・時間的特徴を学習し、多段階の抽象化を可能にする。
  • 2段階のアーキテクチャを採用:まず動的サンプリングで生のタッチシーケンスを変換し、次にCNNが正規化されたシーケンスを処理して分類する。
  • 特徴マップの数やネットワークの深さを調整することでモデル容量を最適化し、異なるパrameter数での性能を比較する。
  • 1ストロークの軌跡に1次元畳み込みを適用し、幾何的遷移(例:コーナー)を空間的勾配のしきい値で検出することで、記号的ジェスチャー認識にモデルを適応させる。

実験結果

リサーチクエスチョン

  • RQ11次元畳み込みニューラルネットワーク(CNN)は、時間的トポロジーを保持しつつ、可変長のタッチジェスチャーシーケンスを分類する際、再帰型ネットワーク(RNN)を上回ることができるか?
  • RQ2動的サンプリングは、シーケンス長を短縮しつつも、接触・離脱などの重要なタッチ遷移をどれほど効果的に保持できるか?
  • RQ3ユーザー定義のジェスチャー規約なしに、1つの汎用モデルが多様なユーザー、デバイス、ジェスチャー様式にどれほど一般化できるか?
  • RQ4提案手法は、MMGのような標準的な記号的ジェスチャーベンチマークで、既存の最先端手法を上回るほぼ完璧な性能(99.38%)を達成できるか?
  • RQ5モデルの実行時間効率はどの程度で、CPUや組み込みシステム上でリアルタイムデプロイが可能か?

主な発見

  • CNNモデルは、446,983パラメータで本稿で提案したデータセットで89.96%の精度を達成し、4層スタックドLSTM(73.65%)を、パラメータ数が少ないにもかかわらず顕著に上回った。
  • MMGデータセットでは、ユーザー非依存評価で99.38%の精度を達成し、以前の最先端手法(98.0%)を上回った。
  • MMGデータセットにおける1人を除いた交差検証評価では98.62%の精度を示し、ユーザー間での一般化性能が優れていることを確認した。
  • GPUでは1ジェスチャーのテストにわずか1.5ms、CPUでは5msで実行可能であり、リアルタイム処理の実現可能性が明確に示された。
  • 動的サンプリング手法は、入力シーケンス長を短縮しつつも、重要な信号遷移を効果的に保持しており、安定かつ正確な分類を可能にした。
  • アブレーションスタディにより、CNNとRNNモデル間の性能差はパラメータ数の違いに起因するのではなく、CNNが階層的表現を学習できる能力に起因することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。