Skip to main content
QUICK REVIEW

[論文レビュー] Human Attention Estimation for Natural Images: An Automatic Gaze Refinement Approach

Jinsoo Choi, Tae-Hyun Oh|arXiv (Cornell University)|Jan 12, 2016
Visual Attention and Saliency Detection参考文献 47被引用数 4
ひとこと要約

本稿では、統合された注視追跡と計算的サリエンシー・モデルを用いて、ユーザー参加を要しない暗黙的アプローチにより、自然画像におけるリアルタイムの人間の注目領域推定を提案する。ウェブカメラを用いた注視追跡と段階的GMMクラスタリング、およびサリエンシーの最適化を活用することで、ユーザーの注目傾向を能動的な参加なしに学習可能となり、正確な個人向けサリエンシー地図を生成し、個人化された写真検索やタグ提案などの応用を可能にする。

ABSTRACT

Photo collections and its applications today attempt to reflect user interactions in various forms. Moreover, photo collections aim to capture the users' intention with minimum effort through applications capturing user intentions. Human interest regions in an image carry powerful information about the user's behavior and can be used in many photo applications. Research on human visual attention has been conducted in the form of gaze tracking and computational saliency models in the computer vision community, and has shown considerable progress. This paper presents an integration between implicit gaze estimation and computational saliency model to effectively estimate human attention regions in images on the fly. Furthermore, our method estimates human attention via implicit calibration and incremental model updating without any active participation from the user. We also present extensive analysis and possible applications for personal photo collections.

研究の動機と目的

  • アクティブなユーザー参加や専用ハードウェアを要せず、自然画像内の人の注目領域を推定すること。
  • 暗黙の注視追跡を計算的サリエンシー・モデルと統合し、個々の視認行動に基づいて注目マップを最適化すること。
  • 写真閲覧の受動的観察を通じて、リアルタイムで段階的な学習によりユーザー固有の注目傾向を学習すること。
  • 個人用写真コレクションにおける応用、例えばサリエンシーの最適化、タグ提案、注目に基づく写真検索を実証すること。
  • 標準的なウェブカメラと最小限のキャリブレーションを用いた、スケーラブルで実用的なオフザシェルソリューションを構築すること。

提案手法

  • 自然な写真閲覧中にウェブカメラで眼の注視位置をキャプチャし、明示的なユーザー入力なしに暗黙的キャリブレーションを可能にする。
  • 時間経過に伴いユーザー固有の注視分布パターンを学習するため、段階的ガウス・ミックスチャネル・モデル(GMM)クラスタリングを適用する。
  • 学習された注視分布と事前学習済みの計算的サリエンシー・モデルをモード探索統合により統合し、注目マップを最適化する。
  • リアルタイムにGMMおよびガウス過程回帰(GPR)モデルを更新する、効率的な段階的学習パイプラインを採用する。
  • 写真検索タスクでは、正規化されたサリエンシー地図の重複率に基づく類似度測定(Sim(s,t) = ∫ min(s(x), t(x)) dx)を用いる。
  • 計算コストを低減するため、GMMのパラメータ(平均、共分散、重み、カウント推定)を保存・更新する。

実験結果

リサーチクエスチョン

  • RQ1標準的なウェブカメラからの暗黙的注視追跡が、明示的なユーザーキャリブレーションなしに、個人の注目傾向を効果的に捉えられるか?
  • RQ2注視データと計算的サリエンシー・モデルの統合により、自然なシーンにおける人の注目予測の精度がどの程度向上するか?
  • RQ3注視データによる段階的モデル更新が、受動的かつ非侵襲的な方法で、時間経過とともにどの程度のパーソナライズ効果を発揮するか?
  • RQ4提案手法が、サリエンシーの最適化や注目に基づく写真検索といった実用的でユーザー固有の応用を可能にするか?
  • RQ5実ユーザーのデータにおいて、最先端のサリエンシー・モデルと比較して、本手法のパーソナライズ性と性能はどの程度優れているか?

主な発見

  • 注視データと計算的サリエンシーの統合により、単独のサリエンシー・モデルで一般的に見られる誤検出を顕著に低減し、正確な個人向けサリエンシー地図を実現した。
  • 段階的GMMクラスタリングにより、最小限の計算コストで効果的なユーザー固有のモデル適応が可能であり、100イタレーション以内に収束を達成した。
  • 通常の写真閲覧の過程で受動的にユーザーの注目傾向を学習し、明示的なトレーニングや操作ステップが不要であった。
  • 個人の注目領域をクエリとして用いた写真検索において、上位順の結果がユーザーの関心領域と一致した。
  • 顔検出に基づく従来手法に比べ、高注目領域かつ顔でない領域のタグ提案が可能となり、タグ提案の応用で優れた性能を示した。
  • 10名の被験者を対象とした実験で、パーソナライズされた環境下でベースラインのサリエンシー・モデルよりも一貫した性能向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。