Skip to main content
QUICK REVIEW

[論文レビュー] Active Mining of Parallel Video Streams

Samaneh Khoshrou, Jaime S. Cardoso|arXiv (Cornell University)|May 14, 2014
Data Stream Mining Techniques参考文献 32被引用数 3
ひとこと要約

本論文では、複数カメラ監視環境における並列で進化的な動画ストリームにおける動画オブジェクトの段階的分類のための半教師ありアクティブラーニングフレームワーク、NEVILを提案する。人間によるアノテーションに最も情報量の多いサンプルを適応的に選択し、動的融合ルールを用いて複数の分類器を統合することで、合成データでは15%未満のアノテーション作業で90%以上の精度を達成し、実際のCAVIARデータでは30%未満のラベル作業で80%以上の精度を達成する。これは、受動的およびベースラインのアクティブラーニング手法を上回る性能を示している。

ABSTRACT

The practicality of a video surveillance system is adversely limited by the amount of queries that can be placed on human resources and their vigilance in response. To transcend this limitation, a major effort under way is to include software that (fully or at least semi) automatically mines video footage, reducing the burden imposed to the system. Herein, we propose a semi-supervised incremental learning framework for evolving visual streams in order to develop a robust and flexible track classification system. Our proposed method learns from consecutive batches by updating an ensemble in each time. It tries to strike a balance between performance of the system and amount of data which needs to be labelled. As no restriction is considered, the system can address many practical problems in an evolving multi-camera scenario, such as concept drift, class evolution and various length of video streams which have not been addressed before. Experiments were performed on synthetic as well as real-world visual data in non-stationary environments, showing high accuracy with fairly little human collaboration.

研究の動機と目的

  • ラベル付きデータが乏しく、取得に高コストがかかるマルチカメラ監視環境における高いアノテーションコストの課題に対処すること。
  • 非定常な視覚的環境におけるコンセプトドリフトやクラスの進化に適応できる、強固で段階的な学習フレームワークの開発。
  • 長さが異なる、重複する視野を持つ複数の動画ストリームにおいて、人間によるラベリング作業を最小限に抑えつつ、高い分類精度を維持すること。
  • カメラの重複に関する仮定を一切設けず、継続的な学習を可能にし、重複するカメラ配置と非重複するカメラ配置の両方をサポートすること。
  • 実際の監視データと合成データにおける、異なる分類器の組み合わせ、選択戦略、融合ルールの有効性を評価すること。

提案手法

  • 本フレームワークであるNEVILは、バッチ単位で動画ストリームを処理し、時間経過とともにアンサンブル分類器を更新する、半教師あり段階的学習アプローチを採用する。
  • 性能を維持しつつラベル作業を削減するため、人間によるアノテーションに最も情報をもたらすインスタンスを効果的に選択するアクティブラーニング戦略を採用する。
  • 修正マージンや修正最も信頼性の高い(modified most confident)といった、複数の情報量指標を用いて、不確実性が高く多様性のあるサンプルを優先して、オラクルクエリを誘導する。
  • 分類器の出力を、和則(sum rule)、積則(product rule)、幾何平均といった融合ルールを用いて統合し、信頼性と多様性に基づいて動的選択を行う。
  • オブジェクトの外観を複数のストリームにわたって追跡し、時間的に同期させることで、カメラ間をまたがるオブジェクトIDを一貫して維持する。
  • 本フレームワークは、制御されたコンセプトドリフトを伴う合成データと、複雑で高次元の視覚的特徴を持つ実際のCAVIARシーケンスの両方を用いて評価される。

実験結果

リサーチクエスチョン

  • RQ1コンセプトドリフトやクラスの進化を伴う、進化的なマルチカメラ動画ストリームに対して、アクティブラーニングをどのように効果的に適用できるか。
  • RQ2ベース分類器の組み合わせ、融合ルール、情報量指標のうち、どれが人間によるラベリング作業を最小限に抑えつつ最高の精度を達成するか。
  • RQ3低次元でクリーンなデータと高次元でノイジーな実世界の動画ストリームにおいて、生成モデルと判別モデルの性能はどのように異なるか。
  • RQ4空間的配置に関する事前仮定を一切設けずに、重複するカメラ視野と非重複するカメラ視野の両方を統一フレームワークで処理できるか。
  • RQ5長期的かつ継続的な動画監視において、ラベリングコストと分類精度の最適なトレードオフは何か。

主な発見

  • 合成データでは、NEVILは15%未満のアノテーション作業で90%以上の精度を達成し、受動的学習およびベースラインのアクティブラーニング手法を著しく上回る。
  • 実際のCAVIARシーケンスでは、30%未満のラベル作業で80%以上の精度を達成し、実世界データにおけるノイズと複雑さに対して強いロバストネスを示している。
  • 低次元でクリーンな合成データでは、生成モデル(例:ナイーブベイズ)が判別モデルを上回り、低ノイズ環境下での柔軟性が顕著に現れている。
  • 高次元でノイジーな実世界データでは、SVM やロジスティック回帰といった判別モデルが生成モデルを上回り、おそらく尤度推定における局所最適解のより良い取り扱いによるものと考えられる。
  • 実データでは、算術平均(SUM)融合と修正マージン(MM)選択基準の組み合わせが最良のパフォーマンスを示したが、合成データでは幾何平均と修正最も信頼性の高い(modified most confident)が最良であった。
  • 本フレームワークは、カメラの重複に関する事前仮定を一切設けずに、コンセプトドリフトやクラスの進化に対処でき、多様な監視構成に応用可能であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。