Skip to main content
QUICK REVIEW

[論文レビュー] Object-Scene Convolutional Neural Networks for Event Recognition in Images

Limin Wang, Zhe Wang|arXiv (Cornell University)|May 2, 2015
Human Pose and Action Recognition参考文献 13被引用数 7
ひとこと要約

本論文では、静止画におけるイベント認識のため、オブジェクトレベルとシーンレベルの特徴を別々に抽出する二重スティーム深層学習アーキテクチャであるObject-Scene Convolutional Neural Networks (OS-CNN)を提案する。ImageNetとPlacesで事前学習された深層(AlexNet/ClarifaiNet)および非常に深層(GoogLeNet)ネットワークからの特徴を統合することで、85.5%の正確度を達成し、文化的イベント認識のためのChaLearn LAP 2015チャレンジで第1位を獲得した。

ABSTRACT

Event recognition from still images is of great importance for image understanding. However, compared with event recognition in videos, there are much fewer research works on event recognition in images. This paper addresses the issue of event recognition from images and proposes an effective method with deep neural networks. Specifically, we design a new architecture, called Object-Scene Convolutional Neural Network (OS-CNN). This architecture is decomposed into object net and scene net, which extract useful information for event understanding from the perspective of objects and scene context, respectively. Meanwhile, we investigate different network architectures for OS-CNN design, and adapt the deep (AlexNet) and very-deep (GoogLeNet) networks to the task of event recognition. Furthermore, we find that the deep and very-deep networks are complementary to each other. Finally, based on the proposed OS-CNN and comparative study of different network architectures, we come up with a solution of five-stream CNN for the track of cultural event recognition at the ChaLearn Looking at People (LAP) challenge 2015. Our method obtains the performance of 85.5% and ranks the $1^{st}$ place in this challenge.

研究の動機と目的

  • 動画と比較して動きの手がかりが限られる静止画におけるイベント認識の課題に対処すること。
  • オブジェクトとシーンの文脈からの補完的視覚的手がかりを活用することで、イベント認識を向上させること。
  • 画像ベースのイベント認識に適した、さまざまな深層および非常に深層CNNアーキテクチャの有効性を調査すること。
  • より優れた性能を達成するため、複数のネットワークスティームを統合するロバストなアンサンブルベースのソリューションを開発すること。

提案手法

  • オブジェクトネットとシーンネットを別々に処理するための、独立したオブジェクト特徴とシーン特徴を処理する二重スティームアーキテクチャであるOS-CNNを提案する。
  • オブジェクトネットをImageNetで、シーンネットをPlacesで事前学習することで、より良い特徴学習のための大規模なアノテート済みデータを活用する。
  • 最終予測のため、オブジェクトスティームとシーンスティームからの分類スコアを後期統合(late fusion)によって統合する。
  • チャレンジのトレーニングデータを用いた微調整により、事前学習済みモデルを文化的イベント認識タスクに適応させる。
  • 性能と補完性を評価するために、AlexNet、ClarifaiNet(深層)、GoogLeNet(非常に深層)といった複数のネットワークアーキテクチャを検討する。
  • 異なるアーキテクチャと事前学習データセットを組み合わせた五スティームCNNアンサンブルを構築し、性能を最大化する。

実験結果

リサーチクエスチョン

  • RQ1オブジェクトとシーンの文脈を別々にモデル化する二重スティームCNNアーキテクチャは、静止画におけるイベント認識にどの程度有効か?
  • RQ2GoogLeNetのような非常に深層CNNは、AlexNetのような深層CNNよりも画像ベースのイベント認識で優れているか?
  • RQ3深層および非常に深層ネットワークを統合することで、イベント認識においてどの程度相乗効果が得られるか?
  • RQ4異なるアーキテクチャおよび事前学習データを有する複数のスティームを後期統合することで、認識正確度が向上するか?

主な発見

  • OS-CNNを用いた五スティームCNNアンサンブルは、トップ-1正確度85.5%を達成し、ChaLearn LAP 2015チャレンジで第1位を獲得した。
  • 非常に深層ネットワーク(GoogLeNet)は、深層ネットワーク(AlexNet)よりも平均平均精度(mean average precision)で約3%優れていた。
  • 深層と非常に深層アーキテクチャを統合することで、単独で使用した場合と比較して約2%の性能向上が得られた。
  • オブジェクトネット単体がシーンネットを上回ったことから、このタスクにおいてオブジェクトレベルの手がかりがイベント認識においてより判別力に優れていることが示された。
  • オブジェクトネットとシーンネットが学習したフィルタは、共通のパターン(例:エッジ)を示す一方で、相補的な特徴も示しており、二重スティーム設計の有効性が裏付けられた。
  • ImageNetおよびPlacesでの事前学習に加え、微調整を施すことで、文化的イベント認識タスクにおける認識性能が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。