Skip to main content
QUICK REVIEW

[論文レビュー] OpenEDS2020: Open Eyes Dataset

Cristina Palmero, Abhishek Sharma|arXiv (Cornell University)|May 8, 2020
Gaze Tracking and Assistive Technology参考文献 25被引用数 5
ひとこと要約

OpenEDS2020 は、VR環境下で二台の同期された眼動追跡カメラを用いて収集された、高解像度(640×400)、100 Hz の眼画像シーケンスからなる大規模かつ匿名化されたデータセットである。本データセットは、空間的・時間的 gaze 予測および眼分類に役立つものであり、gaze 予測では平均 5.37° の角誤差、セマンティック分類では 84.1% の mIoU を達成しており、リアルタイム VR アプリケーションのベンチマークとして機能する。

ABSTRACT

We present the second edition of OpenEDS dataset, OpenEDS2020, a novel dataset of eye-image sequences captured at a frame rate of 100 Hz under controlled illumination, using a virtual-reality head-mounted display mounted with two synchronized eye-facing cameras. The dataset, which is anonymized to remove any personally identifiable information on participants, consists of 80 participants of varied appearance performing several gaze-elicited tasks, and is divided in two subsets: 1) Gaze Prediction Dataset, with up to 66,560 sequences containing 550,400 eye-images and respective gaze vectors, created to foster research in spatio-temporal gaze estimation and prediction approaches; and 2) Eye Segmentation Dataset, consisting of 200 sequences sampled at 5 Hz, with up to 29,500 images, of which 5% contain a semantic segmentation label, devised to encourage the use of temporal information to propagate labels to contiguous frames. Baseline experiments have been evaluated on OpenEDS2020, one for each task, with average angular error of 5.37 degrees when performing gaze prediction on 1 to 5 frames into the future, and a mean intersection over union score of 84.1% for semantic segmentation. As its predecessor, OpenEDS dataset, we anticipate that this new dataset will continue creating opportunities to researchers in eye tracking, machine learning and computer vision communities, to advance the state of the art for virtual reality applications. The dataset is available for download upon request at http://research.fb.com/programs/openeds-2020-challenge/.

研究の動機と目的

  • リアルタイム VR/AR アプリケーションに適した、高解像度、時間的密度が高く、匿名化された眼動追跡データセットの不足を解消すること。
  • 特に、foveated rendering の遅延補償に役立つ、空間的・時間的 gaze 評価と予測に関する研究を可能にすること。
  • 時間的整合性とスパarsなアノテーションを活用して、頑健な眼分類モデルの開発を支援すること。
  • コンピュータビジョン、機械学習、眼動追跡分野における没入型技術の最先端を推進するベンチマークデータセットを提供すること。
  • 制御された照明条件と多様な参加者デモグラフィーを備えた、公開可能でプライバシー保護が施されたデータセットを通じて、再現性のある研究を促進すること。

提案手法

  • 本データセットは、100 Hz で動作する二台の同期された眼向けカメラを搭載した VR HMD を用いて収集された。80名の参加者が gaze 刺激タスクを実行した。
  • Gaze Prediction Dataset には、時間的モデリングを目的として、最大 66,560 個のシーケンス(合計 550,400 枚の眼画像)と、対応する 3D gaze ベクトルが含まれる。
  • Eye Segmentation Dataset には、5 Hz でサンプリングされた 200 個のシーケンスが含まれ、そのうち 5% のフレームに、網膜、虹彩、瞳孔、背景のセマンティック分類マスクが付与されている。
  • 3D gaze 予測のベースラインとして、32 ニューロンの全結合層と 2 ニューロンの線形回帰ヘッドを備えた CNN を実装。クラスの不均衡を補うためにデータウェイトを適用し、75% のデータで学習した。
  • gaze 予測には、50 フレームのスライディングウインドウを用い、将来 5 フレーム分の gaze を線形回帰で予測する手法を採用した。
  • セマンティック分類のベースラインには、軽量なエンコーダ・デコーダ CNN を採用。深度分離畳み込みと乗法的スキップ接続を用い、1,605 枚のアノテート済み画像で学習した。

実験結果

リサーチクエスチョン

  • RQ1過去 50 フレーム分の gaze 評価のみを用いて、単純な線形回帰モデルが将来の gaze 位置を効果的に予測できるか。
  • RQ2特に、急速な眼動作(saccades)の際、gaze 予測の性能は時間経過とともにどのように低下するか。
  • RQ35% のフレームにのみ完全なセマンティック分類マスクが与えられた状況で、時間的情報を活用することで、眼画像のセマンティック分類精度はどの程度向上するか。
  • RQ4スパarsなアノテーションを用いながらも、低コストな計算量で高い分類精度(mIoU)を達成できる軽量ディープラーニングモデルは実現可能か。
  • RQ5眼分類と gaze 評価の品質は、foveated rendering などの下流 VR アプリケーションの性能に、どの程度相関するか。

主な発見

  • gaze 予測のベースラインは、50ms 未満の未来の gaze を予測する際、平均 5.37° の角誤差を達成した。誤差は時間経過とともに徐々に増加した。
  • gaze 予測の p95 誤差は 12.48° に達し、線形モデルが急速な saccadic 動作を予測する際の大きな課題を示している。
  • 時間的モデリングを用いずにスパarsなアノテーションのみを用いたセマンティック分類ベースラインは、テストセットで平均交差率(mIoU)84.1% を達成した。
  • 背景では 97.1%、網膜では 67.4%、虹彩では 88.2%、瞳孔では 83.5% の mIoU を達成しており、大多数の構造で優れた性能を示した。
  • 訓練済みの gaze 評価ネットワークは、検証セットで平均 4.58° の誤差を達成し、最先端の subject-independent メソッドと整合した。
  • 本データセットの高い時間的解像度(100 Hz)と制御された環境により、saccades を含む急速な眼動作の正確なモデリングが可能となり、リアルタイム VR システムにとって不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。