[論文レビュー] Determining the best attributes for surveillance video keywords generation
本稿では、意味のある属性における共有構造的パターンを活用することで、監視映像キーワード生成のための最適な属性発見手法を自動的に選択する新規手法を提案する。PiCoDeS、スペクトルハッシュ、LSH といった手法を評価し、PiCoDeS が最も高いキーワード正確度(77.7%のヒット率)を達成することを示した。これにより、bag-of-words 特徴量に依存せずに、高品質な動画記述を維持したまま、人的ラベリング作業の負担を著しく削減できる。
Automatic video keyword generation is one of the key ingredients in reducing the burden of security officers in analyzing surveillance videos. Keywords or attributes are generally chosen manually based on expert knowledge of surveillance. Most existing works primarily aim at either supervised learning approaches relying on extensive manual labelling or hierarchical probabilistic models that assume the features are extracted using the bag-of-words approach; thus limiting the utilization of the other features. To address this, we turn our attention to automatic attribute discovery approaches. However, it is not clear which automatic discovery approach can discover the most meaningful attributes. Furthermore, little research has been done on how to compare and choose the best automatic attribute discovery methods. In this paper, we propose a novel approach, based on the shared structure exhibited amongst meaningful attributes, that enables us to compare between different automatic attribute discovery approaches.We then validate our approach by comparing various attribute discovery methods such as PiCoDeS on two attribute datasets. The evaluation shows that our approach is able to select the automatic discovery approach that discovers the most meaningful attributes. We then employ the best discovery approach to generate keywords for videos recorded from a surveillance system. This work shows it is possible to massively reduce the amount of manual work in generating video keywords without limiting ourselves to a particular video feature descriptor.
研究の動機と目的
- 監視映像キーワード生成における自動属性発見のための体系的比較手法の欠如に対処すること。
- スケーラビリティと未観測イベントへの適応性を制限する、膨大な人的ラベリング作業への依存を軽減すること。
- 異なる発見手法において最も意味のある属性を特定する選択フレームワークの開発。
- 実際の監視映像データセット上でフレームワークを検証し、正確で人間が理解可能なキーワードを生成する有効性を示すこと。
提案手法
- 意味のある属性における共有構造に基づく距離関数を用いて、発見された属性の意味的有意性を測定する。
- 既知の意味のある属性の集合を「基準目盛り」として、異なる自動属性発見手法の評価と比較に用いる。
- 2つの属性データセットに対して、PiCoDeS、スペクトルハッシュ(SH)、局所性に敏感なハッシュ(LSH)を比較する応用を実施。
- 1動画あたりに正しく特定されたキーワードの正確度(ヒット率)を指標として用い、属性および行動ごとに集計された結果を評価。
- 追加の人的ラベリングを要せず、最良の性能を示す属性発見手法の選択を可能にする。
- 選択された手法を用いて、人的作業を最小限に抑えたエンドツーエンドのキーワード生成を実現。
実験結果
リサーチクエスチョン
- RQ1どの自動属性発見手法が監視映像キーワード生成に最も意味的有意義な属性を生成するか?
- RQ2人的アノテーションに依存せずに、異なる属性発見手法を客観的に比較する方法は何か?
- RQ3意味のある属性間に共通する構造的パターンを用いて、属性品質の信頼性のある指標を定義できるか?
- RQ4提案された選択手法は、異なるデータセットおよび動画コンテンツにおいて一貫して最良の手法を特定できるか?
- RQ5選択された手法は、高いキーワード正確度を維持したまま、人的ラベリング作業をどの程度削減できるか?
主な発見
- PiCoDeS は 77.7% の最高のキーワードヒット率を達成し、テストデータセット上でスペクトルハッシュ(55.9%)および LSH(48.3%)を顕著に上回った。
- PiCoDeS が発見した大多数の属性が 70% 以上のヒット率を示し、2つの属性が 100% の正確度を達成した。
- 人的ラベリングタスク(HIT)の必要数を、学習サンプル数 N から発見された属性数 J に削減でき、時間的・経済的コストの大幅な削減が可能になった。
- 評価により、提案された距離関数が意味のある属性集合を効果的に特定できることを確認し、選択基準としての有効性が裏付けられた。
- 特定の動画特徴記述子に制約されない、スケーラブルで低コストな動画キーワード生成が可能になった。
- 結果から、意味のある属性における構造的パターンを用いることで、自動属性発見の評価と選択が有効に行えることが示され、監視システムへの実用的導入が可能であることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。