[論文レビュー] Do Pedestrians Pay Attention? Eye Contact Detection in the Wild
本稿では、実世界の自動運転シナリオにおけるアイコンタクト検出のためのキーポoinに基づく深層学習モデルを提案する。生画像の代わりに意味的ボディキーポイントを活用することで一般化性能を向上させる。JAADデータセットにおいて最先端の性能を達成し、多様で大規模なLOOKという、制約のない環境における実世界一般化を対象としたベンチマークを導入する。
In urban or crowded environments, humans rely on eye contact for fast and efficient communication with nearby people. Autonomous agents also need to detect eye contact to interact with pedestrians and safely navigate around them. In this paper, we focus on eye contact detection in the wild, i.e., real-world scenarios for autonomous vehicles with no control over the environment or the distance of pedestrians. We introduce a model that leverages semantic keypoints to detect eye contact and show that this high-level representation (i) achieves state-of-the-art results on the publicly-available dataset JAAD, and (ii) conveys better generalization properties than leveraging raw images in an end-to-end network. To study domain adaptation, we create LOOK: a large-scale dataset for eye contact detection in the wild, which focuses on diverse and unconstrained scenarios for real-world generalization. The source code and the LOOK dataset are publicly shared towards an open science mission.
研究の動機と目的
- 照明、距離、遮蔽の影響により性能が低下する制約のない実世界環境におけるアイコンタクト検出の課題に対処すること。
- 生画像特徴の代わりに高レベルの意味的キーポイントを用いることで、多様なシナリオにわたるモデル一般化性能を向上させること。
- 複数の自動運転データセットをカバーする、大規模で多様なベンチマークデータセット(LOOK)を構築すること。
- 実世界での導入に耐える耐性を評価するために、データセット間一般化性能を評価すること。
- キーポイントベースのモデルが、ドメイン全体にわたる精度と一般化性能の両面で、画像ベースのベースラインを上回ることを示すこと。
提案手法
- 入力画像から17個の意味的キーポイントを、市販のポーズ推定(OpenPifPaf)を用いて抽出する。
- これらの2次元キーポイント座標と信頼度スコアを、軽量で専用のニューラルネットワークを介して処理し、アイコンタクト分類を実行する。
- アイコンタクト予測とキーポイント特徴の精緻化を同時に最適化するマルチタスク学習アーキテクチャを設計し、耐性を向上させる。
- 勾配ベースのセンシティビティ解析を用いてモデルの意思決定を解釈し、キーポイントの重要性を検証する。
- KITTI、nuScenes、JRDBの3つのデータセット間で一般化性能を評価する新しい評価プロトコルを導入し、実世界への転送可能性を評価する。
- 3つの主要な自動運転データセットにわたってアノテーションされた、多様性とドメインシフトに焦点を当てたLOOKデータセットをリリースする。
実験結果
リサーチクエスチョン
- RQ1実世界の変動要因にさらされた状況下で、意味的キーポイント表現が生画像特徴を上回る性能を示せるか?
- RQ2KITTI、nuScenes、JRDBのような多様で制約のないデータセット間で、キーポイントベースのモデルはどの程度一般化するか?
- RQ3高レベルの特徴を用いることで、照明や距離などの環境ノイズへの感受性が低下するか?
- RQ4目のキーポイントや耳のキーポイントなどの個々のキーポイントが、最終的なアイコンタクト予測にどの程度寄与しているか?
- RQ5軽量なキーポイントベースのモデルは、低推論遅延を維持しながらも最先端の性能を達成できるか?
主な発見
- キーポイントベースのモデルは、複数のデータセットで学習した場合、JAADテストセットで85.9%のAPを達成し、画像ベースの最先端手法(71.0% AP)を上回った。
- モデルはデータセット間で顕著に優れた一般化性能を示した。KITTI、nuScenes、JRDBで学習した場合、画像ベースのベースラインとは異なり、JAADで最高の性能を達成した。
- カメラに近い歩行者(小さなバウンディングボックス)に対しても、キーポイントベースの検出は、画像クロップベースの手法よりも効果的であり、近距離では画像クロップが優れているという仮定に反する。
- センシティビティ解析により、目のキーポイントと耳のキーポイントが最も影響力が高く、勾配の大きさが顕著であることが確認され、モデルが関連する特徴に注目していることが妥当性を確認した。
- キーポイント特徴を用いた分類処理は1ms未満で実行可能であり、特にShuffleNetV2のような軽量バックボーンと組み合わせると、極めて効率的である。
- LOOKデータセットは、3つの主要な自動運転データセットにわたる多様で現実世界のシナリオをカバーしており、ドメイン間一般化の堅牢な評価を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。