Skip to main content
QUICK REVIEW

[論文レビュー] Complex Event Recognition from Images with Few Training Examples

Unaiza Ahsan, Chen Sun|arXiv (Cornell University)|Jan 17, 2017
Domain Adaptation and Few-Shot Learning参考文献 48被引用数 4
ひとこと要約

本稿では、WikipediaとFlickrのタグを活用して、Web画像から特徴的でイベント固有の視覚的概念を学習するウェブ駆動型概念発見フレームワークを提案する。事前学習済みCNN特徴を用いて、1つのトレーニング例のみで複雑な社会的イベントを分類する。少サンプルイベント認識において最先端の性能を達成し、未学習カテゴリを含む複数のベンチマーク、特に未確認カテゴリを含むレアイベントデータセットにおいて、直接のCNN微調整を上回る。

ABSTRACT

We propose to leverage concept-level representations for complex event recognition in photographs given limited training examples. We introduce a novel framework to discover event concept attributes from the web and use that to extract semantic features from images and classify them into social event categories with few training examples. Discovered concepts include a variety of objects, scenes, actions and event sub-types, leading to a discriminative and compact representation for event images. Web images are obtained for each discovered event concept and we use (pretrained) CNN features to train concept classifiers. Extensive experiments on challenging event datasets demonstrate that our proposed method outperforms several baselines using deep CNN features directly in classifying images into events with limited training examples. We also demonstrate that our method achieves the best overall accuracy on a dataset with unseen event categories using a single training example.

研究の動機と目的

  • ラベル付き例が僅かにしか利用できない状況において、複雑な社会的・ニュースイベントを画像で認識する課題に対処すること。
  • 手動アノテーションを必要とせず、スケーラブルでウェブベースの方法を用いて関連する視覚的概念(物体、風景、行動、属性)を発見すること。
  • ウェブから得た概念を用いて、未学習のイベントカテゴリにも一般化可能なコンactな特徴表現を構築すること。
  • 従来のCNNが限られた教師信号のため困難に陥る、稀で多様な現実世界のイベントに対して、本手法を評価すること。

提案手法

  • Wikipediaを用いてイベントカテゴリを定義し、関連キーワードを初期概念シードとして抽出する。
  • ノイズの多いFlickrタグに対してツイートセグメンテーションアルゴリズムを適用し、イベント中心のフレーズを抽出する。
  • フレーズをword2vec埋め込みに射影し、最近傍検索により概念プールを拡張する。
  • 各発見された概念についてBing画像検索を用いてWeb画像を収集し、事前学習済みネットワークから深層CNN特徴を抽出する。
  • Web画像とそのCNN特徴を用いて、概念固有の分類器を学習し、各テスト画像の概念スコアを生成する。
  • 得られた概念スコアを、イベント分類のための高レベルでコンactな表現として使用する。
Figure 1: Event concepts as an intermediate feature representation for recognizing social events in photographs.
Figure 1: Event concepts as an intermediate feature representation for recognizing social events in photographs.

実験結果

リサーチクエスチョン

  • RQ1ウェブ由来の視覚的概念は、静止画像における複雑な社会的イベントの少サンプル認識を向上させることができるか?
  • RQ2概念ベースの表現は、概念発見時に未確認であったイベントカテゴリにも一般化するか?
  • RQ3限られたトレーニングデータにおいて、ウェブ教師付き概念学習は、直接の深層CNN微調整と比較して優れているか?
  • RQ4本手法は、1つのトレーニング例でのみ、稀なまたは以前に未確認の現実世界のイベントにおいて強力な性能を達成できるか?

主な発見

  • 本手法は、1クラスあたり1つのトレーニング例のみを用いてWIDERデータセットで平均82.09%の正確度を達成し、AlexNet-fc7(59.79%)およびWEBLY-fc7(55.39%)を上回った。
  • Rare Events Dataset(RED)において、1ショット学習下で21クラス中10クラスでベースラインを上回り、未学習カテゴリへの一般化を示した。
  • 完全なトレーニングデータを用いても、UIUC Sportsでは96.68%、WIDERでは78.59%の正確度を達成し、最先端のベースラインを上回った。
  • 低ショット状況下では、直接のCNN特徴よりも、概念ベースの表現が複雑なイベント認識においてより判別的であることがわかった。
  • 本手法は、'ボストン爆破' や 'ネパール地震' のような多様な現実世界のイベントに対しても、データ不足のため従来モデルが失敗する状況でも、良好な一般化を示した。
Figure 2: Generated segments from Flickr tags for event label ‘protest.’
Figure 2: Generated segments from Flickr tags for event label ‘protest.’

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。