Skip to main content
QUICK REVIEW

[論文レビュー] SideEye: A Generative Neural Network Based Simulator of Human Peripheral Vision

Lex Fridman, Benedikt Jenik|arXiv (Cornell University)|Jun 14, 2017
Advanced Vision and Imaging参考文献 31被引用数 10
ひとこと要約

本稿では、行動的に検証済みのモデルに比べて21,000倍高速な推論を実現する生成的ニューラルネットワーク(FGN)であるSideEyeを紹介する。全視野合成モデルに基づくテクスチャ統計のエンドツーエンド訓練により、FGNは1枚あたり0.7秒(従来の4.2時間)でリアルタイムの周辺視野シミュレーションを達成し、インターフェース設計、ユーザビリティテスト、ロゴ認識分析への実用的応用を可能にする。

ABSTRACT

Foveal vision makes up less than 1% of the visual field. The other 99% is peripheral vision. Precisely what human beings see in the periphery is both obvious and mysterious in that we see it with our own eyes but can't visualize what we see, except in controlled lab experiments. Degradation of information in the periphery is far more complex than what might be mimicked with a radial blur. Rather, behaviorally-validated models hypothesize that peripheral vision measures a large number of local texture statistics in pooling regions that overlap and grow with eccentricity. In this work, we develop a new method for peripheral vision simulation by training a generative neural network on a behaviorally-validated full-field synthesis model. By achieving a 21,000 fold reduction in running time, our approach is the first to combine realism and speed of peripheral vision simulation to a degree that provides a whole new way to approach visual design: through peripheral visualization.

研究の動機と目的

  • 行動的に検証済みのモデルと一致する、高速で現実的な人間の周辺視野シミュレーションを開発すること。
  • 周辺視野可視化の実行時間を数時間からミリ秒単位に短縮し、設計およびHCI研究における実用的応用を可能にすること。
  • 動的デザインの検討とユーザビリティ評価に適したリアルタイムの視錐画像生成を可能にすること。
  • デザイナーや研究者が、混雑したまたは複雑な視覚的状況においてユーザーが一瞥で何を認識するかを予測するためのツールを提供すること。
  • 既存の周辺視野モデルの有用性を拡張し、行動テストやバーチャルリアリティ応用に適した、高スルーレットの視錐画像生成を可能にすること。

提案手法

  • 視錐生成ネットワーク(FGN)は、人間の周辺視野の統計的特性と一致するように、全視野画像を視錐出力にマッピングするエンドツーエンドで訓練される。
  • FGNは、重なり合うプーリング領域を用い、拡大する中心からの距離に応じて領域サイズを増加させる、行動的に検証済みの全視野合成手法「テクスチャ転送モデル(TTM)」を用いて合成された画像の大規模データセットから学習する。
  • ネットワークアーキテクチャは空間的視錐化を組み込み、中心領域は保持され、周辺領域は学習されたテクスチャ統計に基づき段階的に劣化する。
  • 推論の精度を保証するため、FGNの出力がTTMによって生成された視錐画像と一致するように、知覚的損失関数を用いて訓練が行われる。
  • 学習されたマッピングを活用することで、インタラクティブな可視化が可能になり、動的な注視点に対応するリアルタイム推論が実現される。
  • SideEyeオンラインツールでは、ユーザーがデザインをアップロードし、指定された注視点に基づいて即座に周辺視野での外観を可視化できる。

実験結果

リサーチクエスチョン

  • RQ1深層生成ネットワークを用いて、高い知覚的忠実度で人間の周辺視野を正確にシミュレートできるか。
  • RQ2学習されたモデルは、リアリズムを保ちつつ、視錐画像生成の計算コストをどの程度低減できるか。
  • RQ3FGNは、ロゴ認識やインターフェースのユーザビリティといった、現実世界の視覚的タスクにおける人間の知覚的パフォーマンスをどの程度効果的に予測できるか。
  • RQ4リアルタイムの周辺視野シミュレーションは、HCIおよびユーザーエクスペリエンス研究における新しいデザインおよび評価ワークフローを可能にするか。
  • RQ5本モデルの性能は、複雑なシーンやテキストやアイコンなどの記号的要素を含む多様な視覚刺激に対して、どのようにスケーリングするか。

主な発見

  • FGNは実行時間を4.2時間/枚から0.7秒/枚にまで21,000倍短縮した。
  • FGNが生成する視錐画像は、行動的に検証済みのTTMモデルが出力するものと知覚的に一貫しており、周辺視野の信頼性あるシミュレーションが可能である。
  • SideEyeツールにより、周辺知覚のリアルタイム可視化が可能になり、動的なデザイン反復やインターフェースレイアウトのA/Bテストを支援する。
  • 事例研究では、再設計されたウェブサイトレイアウトが、行動誘導ボタンなどの重要な要素の目立たせを向上させたと予測され、ユーザーのクリックスルーレートの上昇と相関した。
  • ロゴ分析では、Spotify、Airbnb、Googleの新しいバージョンのロゴが、eBay や Starbucks の旧バージョンや再設計版と比較して、周辺視野でもよりよく識別可能であることが判明した。
  • 本モデルは、実験中にユーザーの注視点パターンに基づき、オンザフライで数多くの視錐画像を生成でき、迅速な行動評価を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。