[論文レビュー] Visual Decoding of Targets During Visual Search From Human Eye Fixations
本論文は、視線固定データのみを用いてユーザーの心的検索対象を視覚的に復元する最初の手法を提示する。視線プール化エンコーダーを用いて意味的特徴を抽出し、条件付き生成モデルを用いて対象画像を再構築する。この手法は、人間による復元対象の認識で62%の正確性を達成しており、これは偶然の10%よりも顕著に高い。また、局所的な視線情報が正確な再構築に不可欠であることが示された。
What does human gaze reveal about a users' intents and to which extend can these intents be inferred or even visualized? Gaze was proposed as an implicit source of information to predict the target of visual search and, more recently, to predict the object class and attributes of the search target. In this work, we go one step further and investigate the feasibility of combining recent advances in encoding human gaze information using deep convolutional neural networks with the power of generative image models to visually decode, i.e. create a visual representation of, the search target. Such visual decoding is challenging for two reasons: 1) the search target only resides in the user's mind as a subjective visual pattern, and can most often not even be described verbally by the person, and 2) it is, as of yet, unclear if gaze fixations contain sufficient information for this task at all. We show, for the first time, that visual representations of search targets can indeed be decoded only from human gaze fixations. We propose to first encode fixations into a semantic representation and then decode this representation into an image. We evaluate our method on a recent gaze dataset of 14 participants searching for clothing in image collages and validate the model's predictions using two human studies. Our results show that 62% (Chance level = 10%) of the time users were able to select the categories of the decoded image right. In our second studies we show the importance of a local gaze encoding for decoding visual search targets of user
研究の動機と目的
- 視覚的検索対象(直接観察できない心的表象)が、人間の視線固定のみから再構築可能かどうかを調査すること。
- 深層視線符号化と条件付き画像生成を組み合わせることで、検索対象の視覚的再構築を人間が意味的に理解できる形で行う可能性を検討すること。
- 局所的視線情報(固定位置)と、視線の有無のみを考慮するグローバルなパターン(固定の有無)とを比較し、対象再構築における空間的精度の寄与を評価すること。
- 大規模かつ高価な視線データセットの収集を回避するため、事前学習済みモデルと共有意味的表現層を活用する実用的手法を確立すること。
提案手法
- 視線固定の系列を、空間的および時間的視線ダイナミクスを捉える意味的埋め込みに変換するため、視線プール化層を用いる。
- 大規模な画像コーパスで事前学習された条件付き生成モデル(例:条件付きGAN や VAE)に、符号化された視線表現を転送する。
- 視線固定から得られた意味的埋め込みを条件として、対象オブジェクトの画像再構築を生成する。
- 視線エンコーダーと画像生成器を、大規模な画像データセット上で独立して学習させ、意味的層を介して表現の相互転送を実現する。
- 視線の位置情報(局所的)と視線の有無(グローバル)の2つの復元戦略を比較し、空間的精度の寄与を分離する。
- 人間による評価研究を通じて、生成画像の視覚的品質と認識可能性を検証する。
実験結果
リサーチクエスチョン
- RQ1視覚的検索対象は、主観的な心的表象であるにもかかわらず、人間の視線固定のみから復元可能か?
- RQ2視線固定位置(局所的情報)を用いることで、グローバルな視線パターンに比べて、復元された検索対象の品質と認識可能性がどの程度向上するか?
- RQ3人間の観察者は、視線から復元された画像から正しい対象カテゴリをどれほど正確に特定できるか?また、これは偶然の水準を上回るか?
- RQ4大規模な視線データセットの収集を回避するために、事前学習済みモデルと共有意味空間を活用する、実用的でデータ効率の良い手法を開発可能か?
主な発見
- 提案手法は、視線固定から62%の認識正確性で視覚的検索対象を復元でき、これは10%の偶然水準よりも顕著に高い。
- ユーザーは一貫して局所的視線符号化法をグローバル法よりも好んだ。65%のケースで選択され、有意差(p = 0.009)が確認された。
- 主な誤認識は、ブラウス/ドレスやジャケット/カーディガンなど視覚的に類似した衣類カテゴリ間で発生しており、微細な属性の区別が困難であることが示された。
- 局所的視線符号化法は、個々のユーザーの正確性(例:P1で80%)がグローバル法(例:P1で20%)よりも高い結果を示し、空間的固定情報の重要性を裏付けた。
- モデルの性能は参加者間で安定しており、ジーンズ、ショートパンツ、ドレスなどのカテゴリでは高い自信が得られており、特定のオブジェクトクラスではより良い一般化性能を示した。
- 共有意味的層の使用により、大規模な視線特化データセットを必要とせずに、視線符号化と画像生成の間で効果的な転送が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。