Skip to main content
QUICK REVIEW

[論文レビュー] Visual Recognition by Counting Instances: A Multi-Instance Cardinality Potential Kernel

Hossein Hajimirsadeghi, Yan Wang|arXiv (Cornell University)|Feb 6, 2015
Human Pose and Action Recognition参考文献 30被引用数 11
ひとこと要約

本論文は、インスタンス数のカウントを通じて視覚認識をモデル化するカーネルベースのマルチインスタンス学習フレームワークを提案する。確率的潜在構造モデルを用いて、『大多数』や『多ければ多いほど良い』といったハードまたはソフトな基数制約(例:'majority' や 'the more, the better')を符号化する。集団的アクティビティ認識、動画イベント検出(TRECVID MED11)、動画要約(SumMe)の分野で最先端の性能を達成し、mAPが5.0%から6.1%に向上し、一般特徴を用いても競争力のある結果を示した。

ABSTRACT

Many visual recognition problems can be approached by counting instances. To determine whether an event is present in a long internet video, one could count how many frames seem to contain the activity. Classifying the activity of a group of people can be done by counting the actions of individual people. Encoding these cardinality relationships can reduce sensitivity to clutter, in the form of irrelevant frames or individuals not involved in a group activity. Learned parameters can encode how many instances tend to occur in a class of interest. To this end, this paper develops a powerful and flexible framework to infer any cardinality relation between latent labels in a multi-instance model. Hard or soft cardinality relations can be encoded to tackle diverse levels of ambiguity. Experiments on tasks such as human activity recognition, video event detection, and video summarization demonstrate the effectiveness of using cardinality relations for improving recognition results.

研究の動機と目的

  • イベントやアクティビティに関与する関連インスタンス(例:フレームや人物)の数をモデル化することで、視覚認識における曖昧さやごみの影響を軽減すること。
  • 『大多数』や『より多くが良い』といった基数関係を構造的学習フレームワークに符号化することで、認識のロバスト性を向上させること。
  • 基数ポテンシャルを備えたマルチインスタンスモデルに対して、原理的かつ効率的かつ正確な推論と学習手法を開発すること。
  • 基数に基づくモデル化が、動画イベント検出や要約を含む多様な視覚認識タスクに有効であることを実証すること。

提案手法

  • 各動画やシーンをインスタンス(例:フレームや人物)の『バッグ』としてモデル化し、各インスタンスが関心対象のクラスに属するかどうかを示す潜在ラベルを導入する。
  • 確率的潜在構造モデルを用いてバッグを表現し、各インスタンスのラベルは観測不可であり、モデルは基数ポテンシャル関数を通じて依存関係を捉える。
  • 構造的潜在モデルの上に新しいカーネル関数を定義し、正確な推論と学習を可能にするカーネルベース分類を実現する。
  • 基数ポテンシャルは正規分布(例:μ=1, σ=0.1)を用いてモデル化され、『関連フレームが多いほど、予測の信頼性が高くなる』といったソフト制約を可能にする。
  • ハード制約(例:大多数ルール)とソフト基数仮定の両方をサポートしており、曖昧さの度合いに応じた柔軟性を有する。
  • 汎用のカーネルまたは構造的学習ツールと統合可能であり、標準分類器と組み合わせて即座に利用可能である。

実験結果

リサーチクエスチョン

  • RQ1関連インスタンス(例:フレームや人物)の数をモデル化することで、視覚タスクにおける認識性能が向上するか?
  • RQ2『大多数』や『より多くが良い』といった基数制約を、構造的学習フレームワークに効果的に符号化する方法は何か?
  • RQ3基数ポテンシャルを備えた潜在構造モデルに基づくカーネル化アプローチは、標準的手法に比べて動画認識タスクでより優れた性能を発揮するか?
  • RQ4このような手法は、イベント検出、アクティビティ認識、動画要約といった多様なタスクに一般化可能か?

主な発見

  • TRECVID MED11 動画イベント検出ベンチマークにおいて、提案手法は平均平均精度(mAP)6.1%を達成し、以前の最高手法(multi-g ∝ SVM で 5.0%)を上回った。
  • 集団的アクティビティ認識において、複数のアクティビティが同時に発生する状況での曖昧さを解消するために、基数制約を活用することで性能が向上した。特に、多数派のアクティビティが優先された。
  • SumMe データセットにおける動画要約タスクでは、一般特徴(HSVヒストограмと密なトレイジェクトリ)のみを用いても、ベースラインのSVMおよびSVR手法を上回り、最先端の結果を達成した。
  • ラベルの曇りやごみの影響に対しても、特にすべての関連フレームが同等に重要であるとは限らない、または明確にラベル付けされていない状況においても、高いロバスト性を示した。
  • カーネルベースのフレームワークにより、正確な推論と学習が可能となり、実世界の視覚認識応用において実用的で効率的なものとなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。