Skip to main content
QUICK REVIEW

[논문 리뷰] UC Merced Submission to the ActivityNet Challenge 2016

Yi Zhu, Shawn Newsam|arXiv (Cornell University)|2017. 04. 11.
Human Pose and Action Recognition참고 문헌 15인용 수 7
한 줄 요약

이 논문은 ActivityNet Challenge 2016에서 트림되지 않은 영상 행동 인식을 위한 라이트 퓨전 다중 스트림 프레임워크를 제안한다. 수작업으로 만든 MBH 특징과 VGG16, GoogLeNet, C3D, ResNet-101의 딥 네트워크 활성화 특징을 융합한다. 가중 평균과 반복적 재랭킹을 통한 모델 융합을 통해 검증 세트에서 75.14%의 top-1 정확도와 테스트 세트에서 78.44%의 top-1 정확도를 달성하며, 보완적인 저수준 운동 특징과 딥 러닝 표현이 성능 향상에 크게 기여함을 보여준다.

ABSTRACT

This notebook paper describes our system for the untrimmed classification task in the ActivityNet challenge 2016. We investigate multiple state-of-the-art approaches for action recognition in long, untrimmed videos. We exploit hand-crafted motion boundary histogram features as well feature activations from deep networks such as VGG16, GoogLeNet, and C3D. These features are separately fed to linear, one-versus-rest support vector machine classifiers to produce confidence scores for each action class. These predictions are then fused along with the softmax scores of the recent ultra-deep ResNet-101 using weighted averaging.

연구 동기 및 목표

  • 트림되지 않은 장시간 영상에 대한 강건한 행동 인식 시스템을 개발하기 위해.
  • 다양한 아키텍처에서 유도된 수작업 특징(MBH)과 딥 러닝 기반 특징의 융합 효과를 조사하기 위해.
  • 다양한 특징 스트림과 반복적 재랭킹을 통한 늦은 융합을 통해 정확도를 향상시키기 위해.
  • 특징 추출을 위한 행동 제안서와 균일한 프레임 샘플링 간의 영향을 평가하기 위해.
  • 초심층 잔차 네트워크(ResNet-101)의 우수성과 MBH 특징이 딥 특징과 보완적인 관계를 맺는다는 것을 입증하기 위해.

제안 방법

  • 시스템은 Fisher 벡터 인코딩된 MBH 특징, C3D의 fc7 특징, GoogLeNet의 pool5 특징, VGG16의 pool5 특징, ResNet-101의 소프트맥스 점수를 융합하는 다중 스트림 프레임워크를 사용한다.
  • MBH 특징는 사전 계산된 운동 경계에서 추출되며, Fisher 벡터 인코딩을 거쳐 SVM 분류기(C=100)에 의해 처리된다.
  • C3D 특징는 16프레임 클립(50% 겹침)에서 추출되며, PCA를 통해 500차원으로 압축되고 클립 간 평균화된 후 SVM 분류기(C=1)에 의해 처리된다.
  • GoogLeNet과 VGG16 특징는 프레임 단위로 추출되며, 영상 전반에 걸쳐 평균 풀링되고 정규화된다. VGG16 특징는 추가로 LCD와 VLAD를 사용하여 인코딩되며, PCA를 통한 압축이 적용된다.
  • ResNet-101 특징는 데이터셋에 대해 미세조정되며, 추출된 특징보다는 직접 소프트맥스 점수를 융합에 사용한다. 이는 추출 특징보다 성능이 열 劣하므로.
  • 늦은 융합은 가중 평균을 통해 모델 출력을 융합하며, 정확도가 높은 모델은 두 배의 가중치를 부여하고, 이후 다중 클래스 반복적 재랭킹(MIR)을 통해 어려운 예측 사례의 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1수작업으로 만든 운동 경계 히스토GRAM(MBH) 특징와 딥 러닝 기반 특징 간의 성능 비교는 어떻게 되는가?
  • RQ2여러 개의 딥 네트워크 스트림과 MBH 특징를 늦은 융합함으로써 개별 모델을 초월한 정확도 향상이 가능한가?
  • RQ3특행 제안서를 사용한 프레임 샘플링이 영상 분류를 위한 특징 추출에서 균일한 샘플링보다 우월한가?
  • RQ4ResNet-101 아키텍처는 더 얕은 네트워크에 비해 트림되지 않은 장시간 영상에서 행동 인식에 얼마나 효과적인가?
  • RQ5MBH 특징가 딥 네트워크 특징과 함께 시공간 정보를 포괄하는 데 얼마나 보완적인가?

주요 결과

  • ResNet-101 모델은 검증 세트에서 71.81%의 최고 단일 모델 top-1 정확도를 기록하여 다른 모델들을 크게 앞서며 성능을 냈다.
  • 다섯 개의 모듈을 늦은 융합한 결과, 검증 세트에서 75.14%의 top-1 정확도를 달성하여 다중 스트림 융합의 효과를 입증했다.
  • MBH 특징는 개별적으로 가장 열 劣한 성능을 보였음에도 불구하고 융합에 포함되었을 때 성능 향상을 이끌어내어, 딥 특징과의 강력한 보완성을 시사한다.
  • 딥 네트워크 특징만 융합(예: VGG16, GoogLeNet, C3D)하는 경우 MBH 특징를 포함한 융합보다 성능이 열 劣하여, MBH 특징의 독특한 기여도를 강조한다.
  • 행동 제안서를 사용한 프레임 샘플링은 균일한 샘플링보다 성능을 떨어뜨려, 균일한 샘플링이 더 잘 대표적인 영상 콘텐츠를 포착함을 시사한다.
  • 최종 제출물(Run 5)은 테스트 세트에서 mAP 83.1%와 top-1 정확도 78.44%를 기록하여 ActivityNet Challenge 2016에서 상위 입상 수준의 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.