Skip to main content
QUICK REVIEW

[論文レビュー] When Vehicles See Pedestrians with Phones:A Multi-Cue Framework for Recognizing Phone-based Activities of Pedestrians

Akshay Rangesh, Mohan M. Trivedi|arXiv (Cornell University)|Jan 24, 2018
Human-Automation Interaction and Safety被引用数 4
ひとこと要約

本論文は、関節的ポーズ推定、視線追跡、および例示SVMを用いたオブジェクトラベル転送により、スマートフォン関連の歩行者行動(タイピング、通話、無関心)を認識する視覚ベースのマルチケーブルフレームワークを提案する。本手法は、動的モデルに基づくガウス過程パーティクルフィルタを統合し、動画シーケンス全体で効率的かつ正確なポーズ追跡を実現し、新規にアノテートされたデータセット上で低コストで高い精度を達成する。

ABSTRACT

The intelligent vehicle community has devoted considerable efforts to model driver behavior, and in particular to detect and overcome driver distraction in an effort to reduce accidents caused by driver negligence. However, as the domain increasingly shifts towards autonomous and semi-autonomous solutions, the driver is no longer integral to the decision making process, indicating a need to refocus efforts elsewhere. To this end, we propose to study pedestrian distraction instead. In particular, we focus on detecting pedestrians who are engaged in secondary activities involving their cellphones and similar handheld multimedia devices from a purely vision-based standpoint. To achieve this objective, we propose a pipeline incorporating articulated human pose estimation, followed by a soft object label transfer from an ensemble of exemplar SVMs trained on the nearest neighbors in pose feature space. We additionally incorporate head gaze features and prior pose information to carry out cellphone related pedestrian activity recognition. Finally, we offer a method to reliably track the articulated pose of a pedestrian through a sequence of images using a particle filter with a Gaussian Process Dynamical Model (GPDM), which can then be used to estimate sequentially varying activity scores at a very low computational cost. The entire framework is fast (especially for sequential data) and accurate, and easily extensible to include other secondary activities and sources of distraction.

研究の動機と目的

  • スマートフォン使用と関連する歩行者死亡事故の増加に応えるために、特に急速に発展する自動運転車の文脈において、その問題を解決すること。
  • リアルタイムで動作する、視覚ベースのシステムを構築し、歩行者の注意散漫状態を3つのカテゴリ(タイピング、通話、二次的活動なし)に分類すること。
  • ポーズ、視線、手とオブジェクトのインタラクションといったマルチモーダルな手がかりを活用することで、行動認識の精度と効率を向上させること。
  • スパースなポーズ測定値に基づくGPDMベースのパーティクルフィルタを用いて、歩行者のポーズを堅牢かつ低コストで逐次追跡すること。

提案手法

  • 単一画像から関節的ヒューマンポーズを推定するために、深層畳み込みニューラルネットワーク(ConvNet)が用いられ、頭部、首、肩、肘、手首のキーポイント座標が得られる。
  • 最近傍のポーズ特徴空間における近傍点を用いて、事前にオフラインで例示サポートベクターマシン(ESVM)を学習させ、手とオブジェクトのラベル(例:電話の存在)をテスト中の歩行者に転送する。
  • 視線方向の推定には、事前に訓練済みのConvNetが使用され、電話使用の検出に追加の手がかりを提供する。
  • ガウス過程動的モデル(GPDM)がパーティクルフィルタフレームワークに統合され、時間的ダイナミクスをモデル化し、ポーズ追跡の堅牢性を向上させる。
  • ポーズ、視線、オブジェクトの手がかりからのスコアを、ラテナルフィュージョンSVMを用いて統合し、最終的な分類意思決定を生成する。
  • ESVMアンサンブルの更新を50フレームごとに制限することで、計算負荷を低減しながらも、精度を損なわないように効率的にシステムを動作させる。

実験結果

リサーチクエスチョン

  • RQ1マルチケーブル特徴(ポーズ、視線、オブジェクトインタラクション)を用いた視覚ベースのシステムは、タイピング、通話、または無関心の3つに分類される歩行者の注意散漫状態を信頼性高く検出・分類できるか?
  • RQ2ポーズ、視線、オブジェクトインタラクションの手がかりを統合することで、単一の手がかりアプローチと比較して、分類精度がどの程度向上するか?
  • RQ3GPDMベースのパーティクルフィルタは、逐次的な歩行者動画解析において、ポーズ追跡の精度をどの程度向上させ、計算コストを削減できるか?
  • RQ4本フレームワークは、現実世界のシーケンスにおける歩行者の行動の変化や視点の変化に対して、どの程度の性能を示すか?

主な発見

  • 提案されたフレームワークは、急速な行動遷移が発生する中でも、すべての4つのテストシーケンスにおいて、予測ラベルが正解に非常に近い高い精度を達成した。
  • GPDMベースのパーティクルフィルタは、測定値の更新が5フレームに1回(5 Hz)でも、信頼性の高いポーズ追跡を維持し、頭部と首のPCKスコアはそれぞれ0.980および0.975を達成した。
  • 5 Hzの測定値更新でも、フルフレーム追跡と同等の結果が得られ、スパースなポーズ推定が堅牢な性能を発揮することを示した。
  • ESVMアンサンブルの更新を50フレームごとに制限することで、計算コストを削減しながらも、高い分類精度を維持した。
  • 本フレームワークは、一般化性とスケーラビリティに優れており、より多様なトレーニングデータが追加されるにつれて、性能が向上すると予想される。
  • 本手法は、ポーズ、視線、オブジェクトインタラクションの複数の手がかりを効果的に統合し、複雑な現実世界のシナリオにおいても一貫性があり、正確な行動予測を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。