Skip to main content
QUICK REVIEW

[論文レビュー] Periphery-Fovea Multi-Resolution Driving Model guided by Human Attention

Ye Xia, Jinkyu Kim|arXiv (Cornell University)|Mar 24, 2019
Video Surveillance and Tracking Methods参考文献 20被引用数 5
ひとこと要約

本論文では、予測された人間の注視位置によって誘導される低解像度の周辺視界入力と高解像度の中心視野入力を持つ、人間の視覚を模倣する周辺視野-中心視野の多解像度ドライブモデルを提案する。同じFLOP予算のもとで、単一解像度モデルと比較して顕著に高いドライブ精度を達成しており、特に歩行者を含む重要な状況において顕著である。これは、人間の注視監視が、高リスクのドライブシナリオにおける性能向上に寄与することを示している。

ABSTRACT

Inspired by human vision, we propose a new periphery-fovea multi-resolution driving model that predicts vehicle speed from dash camera videos. The peripheral vision module of the model processes the full video frames in low resolution. Its foveal vision module selects sub-regions and uses high-resolution input from those regions to improve its driving performance. We train the fovea selection module with supervision from driver gaze. We show that adding high-resolution input from predicted human driver gaze locations significantly improves the driving accuracy of the model. Our periphery-fovea multi-resolution model outperforms a uni-resolution periphery-only model that has the same amount of floating-point operations. More importantly, we demonstrate that our driving model achieves a significantly higher performance gain in pedestrian-involved critical situations than in other non-critical situations.

研究の動機と目的

  • 人間の視覚の多解像度構造(周辺視野は低解像度、中心視野は高解像度)を模倣するドライブモデルの開発。
  • 強化学習に依存せず、予測された人間の注視位置によって中心視野を重要領域に誘導することで、ドライブ性能の向上。
  • 人間の注視を組み込むことで、特に歩行者との出会いのような重要なドライブ状況においてモデルの精度が向上するかどうかの評価。
  • 同じ計算制約(FLOPs)のもとで、多解像度の中心視野-周辺視野モデルと単一解像度の周辺視野のみのモデルの性能を比較すること。

提案手法

  • モデルは、人間ドライバーの注視位置を予測するための注視位置予測ヘッドを用いて、低解像度のフルフレーム入力を周辺視覚として使用する。
  • 予測された注視位置から高解像度の画像パッチを抽出し、局所的な詳細処理を強化するための中心視覚入力として用いる。
  • 周辺視覚と中心視覚の特徴量を統合し、共有されたプランナに供給して車両の速度を予測する。中心視覚の選択は、ドライバーの真値注視データによって監視される。
  • モデルは、速度予測誤差を最小化する損失関数を用いてエンドツーエンドで訓練され、注視位置予測ヘッドは人間の注視アノテーションを用いて訓練される。
  • テストセットにおける平均絶対誤差(MAE)を用いて性能を評価し、動画フレーム間の時間的相関を考慮するため、パーミュテーション検定を用いて統計的有意性を評価する。
  • 公平な比較が可能となるよう、多解像度モデルと同等のFLOP数を持つ単一解像度の周辺視野のみのベースラインモデルを構築する。

実験結果

リサーチクエスチョン

  • RQ1同じ計算コストのもとで、予測された人間の注視位置によって誘導される多解像度ドライブモデルは、単一解像度の周辺視野のみのモデルよりも高い精度を達成できるか?
  • RQ2歩行者を含むような重要なドライブ状況において、人間の注視を組み込むことでモデル性能が非重要状況と比較してより顕著に向上するか?
  • RQ3さまざまな長さの動画セグメントでテストした場合、中心視野-周辺視野モデルの性能は、中程度解像度の周辺視野のみのモデルと比べてどうなるか?
  • RQ4データセット内のテキスト的正当化アノテーションによって示される高緊急度シナリオにおいて、中心視覚による性能向上が顕著に現れるか?

主な発見

  • 同じFLOP予算のもとで、周辺視野-中心視野の多解像度モデルは、単一解像度の周辺視野のみのモデルよりも顕著に低い予測誤差を達成しており、効率性と精度の両面で優れていることが示された。
  • 歩行者を含む重要な状況において、統計的に有意な性能向上が認められた(p = 0.002)。非重要状況と比較して、誤差低減の度合いが顕著に大きかった。
  • 中程度解像度の周辺視野のみのモデルでは、動画セグメントの長さが延びるにつれて予測誤差が徐々に増加したが、多解像度モデルは全セグメント長にわたり安定的かつ低い誤差を維持した。
  • 全テスト動画長にわたり、同じFLOP使用量のもとで、平均絶対誤差(MAE)がベースラインを常に下回る安定した性能を示した。
  • 高緊急度のシナリオにおいて、中心視覚による性能向上が最も顕著に現れ、人間の注視誘導が重要なドライブ瞬間における意思決定を強化することが示唆された。
  • 注視位置予測に低解像度入力を用いることで、リアルタイム推論の効率性を確保しつつ、重要領域での高精度な中心視覚処理が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。