[論文レビュー] Object-aware Gaze Target Detection
本論文は、シーン内のすべてのオブジェクトを検出するとともに、視線円すを介した頭部-オブジェクト相互作用をモデル化することで、視線ヒートマップ、視線点、および視線を向けたオブジェクト(頭部を含む)のクラスと位置を同時に予測するエンドツーエンドのTransformerベースのアーキテクチャを提案する。この手法は、最先端の性能を達成しており、AUCが最大2.91%向上、視線距離が50%低下、フレーム外平均適合度が9%向上し、視線を向けたオブジェクト分類性能も11–13%向上している。
Gaze target detection aims to predict the image location where the person is looking and the probability that a gaze is out of the scene. Several works have tackled this task by regressing a gaze heatmap centered on the gaze location, however, they overlooked decoding the relationship between the people and the gazed objects. This paper proposes a Transformer-based architecture that automatically detects objects (including heads) in the scene to build associations between every head and the gazed-head/object, resulting in a comprehensive, explainable gaze analysis composed of: gaze target area, gaze pixel point, the class and the image location of the gazed-object. Upon evaluation of the in-the-wild benchmarks, our method achieves state-of-the-art results on all metrics (up to 2.91% gain in AUC, 50% reduction in gaze distance, and 9% gain in out-of-frame average precision) for gaze target detection and 11-13% improvement in average precision for the classification and the localization of the gazed-objects. The code of the proposed method is publicly available.
研究の動機と目的
- 従来の視線ターゲット検出手法が視線ヒートマップ回帰にのみ焦点を当てており、頭部と視線を向けたオブジェクト間の関係をモデル化していないという、オブジェクトレベルの理解の欠如に対処する。
- 手動でアノテートされた頭部クロップに依存する従来の二パスアプローチの限界を克服し、複数人の処理を効率的に行えるようにする。
- 1回の順伝播で頭部、視線を向けたオブジェクト、視線ターゲットを同時に検出することで、エンドツーエンドで説明可能な視線分析を実現する。
- アノテーションのばらつきやフレーム外の視線検出に対するロバストネスを向上させることで、現実世界の「野生の」応用に不可欠な性能を実現する。
- 推論時に補助的なオブジェクト検出器を必要とせず、視線ターゲット検出および視線を向けたオブジェクト認識の両方で優れた性能を達成する。
提案手法
- 1枚の画像入力から、頭部を含むシーン内すべてのオブジェクトを検出するオブジェクト検出用Transformerを活用する。
- 検出された各頭部に対して、視線ベクトル(視線円す)を予測し、人物の視野(FoV)外のオブジェクトを除外する。
- それぞれの視線円す内での頭部とオブジェクト間の相互作用をモデル化するため、マスク付き視線オブジェクトTransformerを採用する。
- 視線オブジェクトTransformerからのアテンション特徴を用いて、視線ヒートマップと高精度な視線点予測を生成する。
- 視線ターゲットが画像フレーム外にあるかどうかを予測する専用ヘッドを統合し、シーン外の視線検出性能を向上させる。
- 視線ヒートマップ回帰、視線点回帰、オブジェクト分類、および位置推定を統合したマルチタスク損失を用いて、全アーキテクチャをエンドツーエンドで訓練する。
実験結果
リサーチクエスチョン
- RQ1エンドツーエンドのTransformerベースのモデルが、視線ターゲットの検出と視線を向けたオブジェクトのクラス・位置同定を同時に実行でき、視線分析における説明可能性を向上させられるか?
- RQ2従来の二パスアプローチや全体的シーンモデリングと比較して、視線円すを介した頭部-オブジェクト相互作用をモデル化することで、視線ターゲット検出性能にどのような影響を与えるか?
- RQ3提案手法は、先行研究と比較して、視線ラベルのアノテーションばらつきに対してどの程度ロバストであるか?
- RQ4モデルは、視線ターゲット検出において最先端の性能を達成すると同時に、正確な視線を向けたオブジェクト分類および位置特定を実現できるか?
- RQ5現実世界のデータセットにおけるアノテーションの不確実性が異なる条件下で、モデルの性能はどのように比較されるか?
主な発見
- 提案手法は、GazeFollowベンチマークにおいて、前回の最先端手法[35]と比較してAUCが2.91%絶対的に向上し、優れた視線ターゲット検出性能を示している。
- 本手法は[35]と比較して平均視線距離を50%低減しており、視線点の局所化が著しく正確であることを示している。
- フレーム外平均適合度が9%向上し、画像外の視線ターゲット検出能力が強化されていることが示された。
- 微調整をCOCOで行わずとも、視線を向けたオブジェクト分類および局所化性能が、ベースラインモデルと比較して平均適合度で11–13%向上した。
- アノテーションばらつきが増加する状況下でも、本手法は一貫して[35]よりも高いAUCを維持しており、人為的ノイズのあるアノテーションに対してロバストであることが示された。
- COCOのオブジェクトアノテーションを学習時に使用していないにもかかわらず、COCOのオブジェクトクラスへの一般化性能が高く、パラメータ効率性と精度の両面でDETRベースのベースラインを上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。