Skip to main content
QUICK REVIEW

[論文レビュー] Gaze Gestures and Their Applications in human-computer interaction with a head-mounted display

Wanyu Chen, Xiaoyu Cui|arXiv (Cornell University)|Oct 16, 2019
Gaze Tracking and Assistive Technology参考文献 61被引用数 6
ひとこと要約

本論文では、1台のRGBカメラを用いたヘッドマウントディスプレイ(HMD)におけるリアルタイムの視線追跡のための深層学習モデル、UEGazeNetおよびUEGazeNet*を提案する。眼のランドマークを検出するとともに視線の軌道を分類することで、10,200件の眼の描画ジェスチャーから成る新規のGTgesturesデータセットにおいて平均96.71%の認識精度を達成し、さまざまな条件下でも最先端のネットワークを52–67%上回る精度を実現した。

ABSTRACT

A head-mounted display (HMD) is a portable and interactive display device. With the development of 5G technology, it may become a general-purpose computing platform in the future. Human-computer interaction (HCI) technology for HMDs has also been of significant interest in recent years. In addition to tracking gestures and speech, tracking human eyes as a means of interaction is highly effective. In this paper, we propose two UnityEyes-based convolutional neural network models, UEGazeNet and UEGazeNet*, which can be used for input images with low resolution and high resolution, respectively. These models can perform rapid interactions by classifying gaze trajectories (GTs), and a GTgestures dataset containing data for 10,200 "eye-painting gestures" collected from 15 individuals is established with our gaze-tracking method. We evaluated the performance both indoors and outdoors and the UEGazeNet can obtaine results 52\% and 67\% better than those of state-of-the-art networks. The generalizability of our GTgestures dataset using a variety of gaze-tracking models is evaluated, and an average recognition rate of 96.71\% is obtained by our method.

研究の動機と目的

  • 低コストの単一RGBカメラセットアップを用いて、ヘッドマウントディスプレイ(HMD)上で耐障害性が高くリアルタイムの視線インタラクションを可能にすること。
  • 高品質な入力、大規模なデータセット、または専用ハードウェアを必要とする従来の視線追跡手法の限界を解消すること。
  • 視線追跡が不完全な状態やユーザーの動きがある状況でも効果を発揮する視線ジェスチャー分類システムの開発。
  • 視線ベースのHCIシステムの学習および評価に適した、多様性に富んだ大規模な視線軌道データセットの作成。

提案手法

  • 眼のランドマークを検出し、それらから視線方向を推定する畳み込みニューラルネットワーク(CNN)であるUEGazeNetを提案。部分的な眼の可視性や極端なカメラアングル下でも頑健な推定が可能になる。
  • 低解像度入力に最適化されたUEGazeNet*というUEGazeNetの変種を導入。グローバルな画像特徴に注目することで性能を向上。
  • UnityEyesを用いて合成データを生成することで、ラベル付けコストを削減し、極端な視点角度を含むデータ拡張が可能になった。
  • 正確なカーソル制御に依存しないように、CNNに基づく視線ジェスチャー分類器を採用。ユーザーの意図を軌道から検出。
  • ランダムなパターン変換を用いて多様性と現実性を高めた15名の参加者から得た10,200件の視線軌道から成るGTgesturesデータセットを収集。
  • データ拡張とリアルタイム追跡を適用し、歩行中や急速な眼動画があるような動的環境でのインタラクションを支援。

実験結果

リサーチクエスチョン

  • RQ1専用ハードウェアや高解像度入力が不要な単一のRGBカメラで、HMD上で正確かつ耐障害性のある視線追跡が可能か?
  • RQ2視線追跡が不完全であっても、またはユーザーが動いている状況でも、深層学習に基づく視線ジェスチャー分類器はユーザーの意図をどれほど効果的に認識できるか?
  • RQ3UnityEyesから生成された合成データは、実世界の条件にうまく一般化する視線推定モデルの学習にどの程度有効に使えるか?
  • RQ4UEGazeNetにおけるランドマークベースのアプローチは、眼の一部が隠れたり、カメラアングルが極端な状況下でも視線推定をどのように改善するか?
  • RQ5本システムは、屋内および屋外を含む制約のない環境でもどの程度の性能を示すか?

主な発見

  • UEGazeNetは屋内環境では52%、屋外環境では67%の高い精度を示し、最先端のネットワークを上回る耐障害性を実証した。
  • GTgesturesデータセットは17種類の視線ジェスチャーパターンにおいて平均96.71%の認識率を達成し、提案手法の高い汎化性能と有効性を裏付けた。
  • 参加者が2回目のデータ収集タスクを完了するのに要する時間が最初の試行(40–50分)と比較して著しく短縮され(20–23分)、視線ジェスチャーインタラクションへの迅速な習得と適応が示された。
  • 視線ジェスチャー分類器は、軌道のばらつきに強い特性を有しており、視線追跡が不正確であっても、またはユーザーが動いている状況でも効果的なインタラクションを可能にした。
  • UnityEyesによる合成データは、最小限の実世界ラベル付けで効果的な学習が可能であり、コスト削減と極端な視点角度のカバー範囲拡大に貢献した。
  • UEGazeNet*はグローバルな画像特徴を活用することで、低解像度入力に対しても効果的に対応でき、リソース制限のあるHMDプラットフォームに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。