Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Egocentric Visual Perception Combining Eye-tracking, a Software Retina and Deep Learning

Nina Hristozova, Piotr Ozimek|ENLIGHTEN (Jurnal Bimbingan dan Konseling Islam)|Sep 5, 2018
CCD and CMOS Imaging Sensors参考文献 5被引用数 4
ひとこと要約

本論文は、人間の眼球追跡データを用いてソフトウェアリトマモデルを誘導することで、入力データを16.7倍に削減しながら9クラスの物体認識タスクで98.2%のテスト精度を達成する、効率的なエゴセントリック視覚認識システムを提案している。バイオインスパイアドの焦点化視覚とディープラーニングの統合により、著しく低い計算負荷で高いパフォーマンスを実現している。

ABSTRACT

We present ongoing work to harness biological approaches to achieving highly efficient egocentric perception by combining the space-variant imaging architecture of the mammalian retina with Deep Learning methods. By pre-processing images collected by means of eye-tracking glasses to control the fixation locations of a software retina model, we demonstrate that we can reduce the input to a DCNN by a factor of 3, reduce the required number of training epochs and obtain over 98% classification rates when training and validating the system on a database of over 26,000 images of 9 object classes.

研究の動機と目的

  • 人間の眼球追跡データを活用して視覚サンプリングを誘導する、効率的なエゴセントリック認識システムの開発。
  • 高解像度のソフトウェアリトマモデルとディープラーニングを統合し、入力データを削減するとともに計算効率を向上。
  • 固定点誘導型の空間可変画像サンプリングを用いて、最先端の分類パフォーマンスを実証。
  • 剛体な頭部安定化を予測的固定点モデリングに置き換えることで、制約のないデータ収集を可能に。
  • 等角写像と皮質的画像変換を用いたスケールおよび回転不変特徴抽出の活用を検討。

提案手法

  • 眼鏡型眼球追跡装置(Tobii Pro 2)が、被験者が顕著な物体領域に固定する際の画像を記録した。
  • 各クラスの固定点の1%に相当する数を基準にK-means法を用いてクラスタリングを行い、代表的な焦点領域を同定した。
  • 50,000ノードのソフトウェアリトマモデルが、複素対数等角写像を用いて、全画像を399×752ピクセルの空間可変皮質画像に変換した。
  • 7層の3×3畳み込み層、マックスプーリング、3層の132ノード全結合層を備えたカスタムDCNNを、皮質画像上で学習した。
  • 皮質画像とフル解像度の固定点クロップ画像の両方を用いた性能比較により、データ効率と正確性をベンチマークした。
  • 皮質画像に散乱点グリッド化アルゴリズムを適用し、さらに入力サイズを縮小しながら正確性を維持した。
Figure 1: Left, Tobii Pro2 Eye Tracker Glasses; Right, Fixation clustering following homography alignment
Figure 1: Left, Tobii Pro2 Eye Tracker Glasses; Right, Fixation clustering following homography alignment

実験結果

リサーチクエスチョン

  • RQ1人間の眼球追跡データは、ソフトウェアリトマの効率的エゴセントリック物体認識を誘導するために効果的に利用可能か?
  • RQ2ソフトウェアリトマの空間可変サンプリングは、分類パフォーマンスを保持しつつ、どの程度入力データを削減できるか?
  • RQ3皮質画像上で学習したDCNNの性能は、フル解像度の固定点クロップ画像上で学習したモデルと比べてどうか?
  • RQ4リトマ出力に直接接続されたカスタムネットワーク層は、中間の皮質画像を生成するのではなく、効率性をさらに向上させられるか?
  • RQ5補助ネットワークは診断的固定点を予測でき、エゴセントリック環境下で制約のないデータ収集を可能にするか?

主な発見

  • 眼球追跡データから導出された皮質画像を用いて、9クラスの物体認識タスクで98.2%のテスト精度を達成した。
  • ソフトウェアリトマの空間可変サンプリングにより、視覚的入力データを16.7倍に削減し、正確性の低下は最小限に抑えられた。
  • 皮質画像ベースのDCNNは、テストセットの分類に6秒で完了したが、フル解像度の固定点クロップモデルでは12秒を要した。
  • フル解像度の固定点クロップモデルは99.5%のテスト精度を達成したが、より大きなバッチサイズと長い学習時間を要した。
  • 皮質画像の散乱点グリッド化アルゴリズムを用いたサブサンプリングにより、10.8倍の入力データ削減が達成され、性能の損失はなかった。
  • 診断的固定点を予測し、任意の部分的遮蔽された視点から物体セグメンテーションを可能にする補助ネットワークの開発が進行中である。
Efficient Egocentric Visual Perception Combining Eye-tracking, a Software Retina and Deep Learning

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。