Skip to main content
QUICK REVIEW

[論文レビュー] Transferring Object-Scene Convolutional Neural Networks for Event Recognition in Still Images

Limin Wang, Zhe Wang|arXiv (Cornell University)|Sep 1, 2016
Human Pose and Action Recognition参考文献 2被引用数 3
ひとこと要約

本論文は、事前学習済みの物体およびシーン畳み込みニューラルネットワークを活用して、静止画像におけるイベント認識を向上させる、新しい転移学習フレームワークOS2E-CNNを提案する。マルチタスク学習フレームワーク内において、初期化ベース、知識ベース、データベースの転移技術を採用することで、3つのベンチマークで最先端の性能を達成し、ChaLearnデータセットでは先行手法よりも最大11%の向上を達成した。

ABSTRACT

Event recognition in still images is an intriguing problem and has potential for real applications. This paper addresses the problem of event recognition by proposing a convolutional neural network that exploits knowledge of objects and scenes for event classification (OS2E-CNN). Intuitively, it stands to reason that there exists a correlation among the concepts of objects, scenes, and events. We empirically demonstrate that the recognition of objects and scenes substantially contributes to the recognition of events. Meanwhile, we propose an iterative selection method to identify a subset of object and scene classes, which help to more efficiently and effectively transfer their deep representations to event recognition. Specifically, we develop three types of transferring techniques: (1) initialization-based transferring, (2) knowledge-based transferring, and (3) data-based transferring. These newly designed transferring techniques exploit multi-task learning frameworks to incorporate extra knowledge from other networks and additional datasets into the training procedure of event CNNs. These multi-task learning frameworks turn out to be effective in reducing the effect of over-fitting and improving the generalization ability of the learned CNNs. With OS2E-CNN, we design a multi-ratio and multi-scale cropping strategy, and propose an end-to-end event recognition pipeline. We perform experiments on three event recognition benchmarks: the ChaLearn Cultural Event Recognition dataset, the Web Image Dataset for Event Recognition (WIDER), and the UIUC Sports Event dataset. The experimental results show that our proposed algorithm successfully adapts object and scene representations towards the event dataset and that it achieves the current state-of-the-art performance on these challenging datasets.

研究の動機と目的

  • 静止画像におけるイベント認識の向上を目的として、物体、シーン、イベントの間の意味的相関関係を調査すること。
  • 大規模な物体およびシーンデータセットからの深層表現の転移を通じて、イベント認識のための限られた学習データの課題に対処すること。
  • 過学習を低減し、一般化性能を向上させる有効な転移学習技術の開発。
  • イベント分類に最も効果的に寄与する、特徴的な物体およびシーンのカテゴリのサブセットを特定すること。
  • マルチレートおよびマルチスケールクローリングを用いたエンドツーエンドのイベント認識パイプラインの設計。

提案手法

  • 事前学習済みの物体およびシーン特徴を統合した、イベント認識を目的とした深層CNNアーキテクチャであるOS2E-CNNを提案する。
  • 3つの転移技術を導入する:(1) 事前学習済みの物体およびシーンネットワーク重みを用いた初期化ベースの転移、(2) 補助的な物体およびシーン分類ヘッドを備えたマルチタスク学習による知識ベースの転移、(3) 追加のImageNetおよびPlaces205データでのファインチューニングによるデータベースの転移。
  • 反復的選択法を用いて、イベント認識に高い判別力を持つ物体およびシーンクラスのサブセットを同定する。
  • 訓練中にマルチレートおよびマルチスケールクローリング戦略を採用し、特徴のロバスト性と空間的カバレッジを向上させる。
  • マルチタスク学習フレームワークを用いて、物体およびシーン分類の補助タスクと同時にイベント認識を最適化することで、一般化性能を向上させる。
  • 転移学習とデータオーグメンテーションを統合したエンドツーエンドの訓練パイプラインを設計し、性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1物体およびシーンの表現はイベント認識とどのように相関しており、どの特定の物体およびシーンカテゴリがイベント分類に最も有益であるか?
  • RQ2事前学習済みの物体およびシーンモデルからの知識転送は、小規模なデータセットにおけるイベント認識性能を顕著に向上させることができるか?
  • RQ3初期化ベース、知識ベース、データベースの各転移技術は、性能および一般化性能の観点でどのように比較されるか?
  • RQ4マルチタスク学習フレームワークは、イベント認識における過学習をどの程度低減し、モデルの一般化性能を向上させることができるか?
  • RQ5統合されたフレームワークは、物体、シーン、イベントの間の階層的意味的関係を効果的に活用し、認識性能を向上させることができるか?

主な発見

  • 提案手法は、ChaLearn Cultural Event Recognitionデータセットで最先端の性能を達成し、前回のSOTAよりトップ1精度で約11%の向上を達成した。
  • UIUC Sports Eventデータセットでは、トップ1精度が98.8%に達し、Couple LDAやディープラーニングベースラインを大きく上回った。
  • 知識ベースおよびデータベースの転移技術は、初期化ベースの転移のみに比べて1%以上の性能向上を示し、特に知識ベースの転移がより強い向上効果を示した。
  • 反復的選択法は、転送効率および精度を向上させる、判別力の高い物体およびシーンクラスのサブセットを効果的に同定した。
  • 失敗事例から、視覚的に類似したイベント(例:中国正月 vs. 平溪花火祭り)の間で混同が生じやすいことが判明し、細分化されたイベントの区別が困難であることが示された。
  • 本手法は、小規模データセットに対しても頑健であることが示され、UIUC Event8データセットでは初期化ベースの転移で96.9%、完全な転移で98.0%の精度を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。