Skip to main content
QUICK REVIEW

[논문 리뷰] Object-Scene Convolutional Neural Networks for Event Recognition in Images

Limin Wang, Zhe Wang|arXiv (Cornell University)|2015. 05. 02.
Human Pose and Action Recognition참고 문헌 13인용 수 7
한 줄 요약

이 논문은 정적 이미지에서 이벤트 인식을 위해 개체 수준 및 장면 수준의 특징을 별도로 추출하는 이중 스트림 딥 러닝 아키텍처인 Object-Scene Convolutional Neural Networks (OS-CNN)를 제안한다. ImageNet과 Places에서 사전 훈련된 깊이 있는 (AlexNet/ClarifaiNet) 및 매우 깊이 있는 (GoogLeNet) 네트워크의 특징을 융합함으로써, 이 방법은 85.5%의 정확도를 달성하여 ChaLearn LAP 2015 챌린지에서 문화 이벤트 인식 분야에서 1등을 기록하였다.

ABSTRACT

Event recognition from still images is of great importance for image understanding. However, compared with event recognition in videos, there are much fewer research works on event recognition in images. This paper addresses the issue of event recognition from images and proposes an effective method with deep neural networks. Specifically, we design a new architecture, called Object-Scene Convolutional Neural Network (OS-CNN). This architecture is decomposed into object net and scene net, which extract useful information for event understanding from the perspective of objects and scene context, respectively. Meanwhile, we investigate different network architectures for OS-CNN design, and adapt the deep (AlexNet) and very-deep (GoogLeNet) networks to the task of event recognition. Furthermore, we find that the deep and very-deep networks are complementary to each other. Finally, based on the proposed OS-CNN and comparative study of different network architectures, we come up with a solution of five-stream CNN for the track of cultural event recognition at the ChaLearn Looking at People (LAP) challenge 2015. Our method obtains the performance of 85.5% and ranks the $1^{st}$ place in this challenge.

연구 동기 및 목표

  • 운동 신호가 제한되어 있어 비디오보다 정적 이미지에서 이벤트 인식이 더 어려운 문제를 해결하기 위해.
  • 개체와 장면 맥락의 보완적인 시각적 신호를 활용하여 이벤트 인식 성능을 향상시키기 위해.
  • 이미지 기반 이벤트 인식에 적합한 다양한 깊이 있는 및 매우 깊이 있는 CNN 아키텍처의 효과를 조사하기 위해.
  • 우수한 성능을 내기 위해 다수의 네트워크 스트림을 융합하는 견고한 앙상블 기반 솔루션을 개발하기 위해.

제안 방법

  • 개체 넷과 장면 넷을 별도로 처리할 수 있도록 독립적인 개체 특징과 장면 특징을 추출하는 이중 스트림 아키텍처인 OS-CNN을 제안한다.
  • 개체 넷은 ImageNet에서, 장면 넷은 Places에서 사전 훈련하여 대규모 애너테이션 데이터를 활용해 더 나은 특징 학습을 유도한다.
  • 최종 예측을 위해 개체 스트림과 장면 스트림의 분류 점수를 후기 융합(fine-tuning) 방식으로 통합한다.
  • 챌린지의 훈련 데이터를 활용해 사전 훈련된 모델을 문화 이벤트 인식 작업에 맞게 미세 조정한다.
  • 성능 평가 및 보완성 검토를 위해 AlexNet, ClarifaiNet(깊이 있는), GoogLeNet(매우 깊이 있는) 등 다양한 네트워크 아키텍처를 탐색한다.
  • 다양한 아키텍처와 사전 훈련 데이터셋을 융합하여 최적의 성능을 내기 위해 다섯 스트림 CNN 앙상블을 구성한다.

실험 결과

연구 질문

  • RQ1정적 이미지에서 이벤트 인식을 위해 개체와 장면 맥락을 별도로 모델링하는 이중 스트림 CNN 아키텍처는 얼마나 효과적인가?
  • RQ2GoogLeNet과 같은 매우 깊이 있는 CNN은 AlexNet과 같은 깊이 있는 CNN보다 이미지 기반 이벤트 인식에서 더 뛰어난 성능을 보일 수 있는가?
  • RQ3깊이 있는 네트워크와 매우 깊이 있는 네트워크를 융합했을 때, 이들이 얼마나 보완적인가?
  • RQ4다양한 아키텍처와 사전 훈련 데이터를 가진 다수의 스트림을 후기 융합하면 인식 정확도가 향상되는가?

주요 결과

  • OS-CNN를 사용한 다섯 스트림 CNN 앙상블은 85.5%의 top-1 정확도를 기록하여 ChaLearn LAP 2015 챌린지에서 1등을 차지했다.
  • 매우 깊이 있는 네트워크(GoogLeNet)는 깊이 있는 네트워크(AlexNet)보다 평균 정밀도에서 약 3% 높은 성능을 보였다.
  • 깊이 있는 네트워크와 매우 깊이 있는 네트워크를 융합함으로써, 개별적으로 사용했을 때보다 약 2% 향상된 성능을 달성했다.
  • 개체 넷은 장면 넷보다 높은 성능을 보였으며, 이는 이 작업에서 개체 수준의 신호가 더 구분력이 높다는 것을 시사한다.
  • 개체 넷과 장면 넷에서 학습된 필터는 공통적인 패턴(예: 에지)을 보이지만, 동시에 서로 다른 보완적인 특징도 나타내어 이중 스트림 설계의 타당성을 뒷받침한다.
  • ImageNet과 Places에서의 사전 훈련에 더해 미세 조정을 통해 문화 이벤트 인식 작업에서의 인식 성능 향상이 크게 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.