Skip to main content
QUICK REVIEW

[논문 리뷰] Pillar Networks++: Distributed non-parametric deep and wide networks

Biswa Sengupta, Qian Yu|ArXiv.org|2017. 08. 18.
Human Pose and Action Recognition참고 문헌 23인용 수 5
한 줄 요약

Pillar Networks++는 다수의 딥 컨volution 네트워크(Inception 및 ResNet)와 제품의 전문가(PoE) 아키텍처에서 가우스 프로세스 분류기를 융합한 분산형 비모수적 딥 러닝 프레임워크를 제안한다. 이는 불확실성 인식이 가능하고 확장 가능한 비디오 동작 인식을 가능하게 하며, 수작업 특징 추출에 의존하지 않고도 HMDB-51 데이터셋에서 최신 기준 73.6%의 정확도를 달성하여 이전 방법들보다 1.4% 높은 성능을 보였다.

ABSTRACT

In recent work, it was shown that combining multi-kernel based support vector machines (SVMs) can lead to near state-of-the-art performance on an action recognition dataset (HMDB-51 dataset). This was 0.4\% lower than frameworks that used hand-crafted features in addition to the deep convolutional feature extractors. In the present work, we show that combining distributed Gaussian Processes with multi-stream deep convolutional neural networks (CNN) alleviate the need to augment a neural network with hand-crafted features. In contrast to prior work, we treat each deep neural convolutional network as an expert wherein the individual predictions (and their respective uncertainties) are combined into a Product of Experts (PoE) framework.

연구 동기 및 목표

  • 카메라 각도, 조명 및 비디오 품질의 높은 변동성으로 인한 비디오 내 동작 인식 과제를 해결하기 위해.
  • 비모수적 베이지안 모델을 결합한 딥 신경망을 활용하여 수작업 특징 추출에 의존하지 않기 위해.
  • 분산형 전문가 네트워크를 통해 비디오 분류의 수평적 확장성을 제공하기 위해.
  • 제품의 전문가(PoE) 프레임워크를 통해 다수의 딥 네트워크 전문가로부터의 불확실성 추정치를 통합하여 예측의 견고성을 향상시키기 위해.

제안 방법

  • 각 딥 네트워크(Inception 및 ResNet)는 독립적인 전문가로 작동하여 RGB 및 옵티컬 플로우 입력으로부터 공간적 및 시간적 특징을 추출한다.
  • 4개의 스트림(이중 Inception 및 이중 ResNet 네트워크)에서 유도된 특징들이 분산형 가우스 프로세스 분류기를 통해 통합된다.
  • 제품의 전문가(PoE) 프레임워크는 개별 예측과 그들의 불확실성을 융합하여 견고성과 캘리브레이션을 향상시킨다.
  • 분산형 GP 설정에서의 추론을 위해 라플라스 근사가 사용되며, 이는 표준 GPU 워크스테이션에서도 효율적인 계산을 가능하게 한다.
  • 시스템 전체를 재학습하지 않고도 추가적인 네트워크 전문가를 통합할 수 있도록 수평적 확장이 가능하다.
  • 비모수적 베이지안 모델링은 더 적은 데이터로도 효과적인 학습이 가능하며 평균 예측과 함께 예측 불확실성까지 제공한다.

실험 결과

연구 질문

  • RQ1수작업 특징 추출에 의존하지 않고도, 분산형 비모수적 앙상블 딥 네트워크가 HMDB-51 동작 인식 벤치마크에서 기존 최신 기준 방법들을 능가할 수 있는가?
  • RQ2다양한 딥 네트워크 전문가와 불확실성 인식 가우스 프로세스 분류기를 융합함으로써 예측의 견고성과 정확도는 어떻게 향상되는가?
  • RQ3제품의 전문가 프레임워크는 다양한 딥 네트워크 출력을 융합할 때 예측의 과도한 확신을 어느 정도 완화할 수 있는가?
  • RQ4분산형 가우스 프로세스는 새로운 네트워크 전문가를 점진적으로 추가할 수 있도록 지원하는 확장 가능하고 모듈러한 비디오 분류를 가능하게 하는가?
  • RQ5베이지안 PoE 프레임워크 내에서의 불확실성 인식 모델 평균화는 다양하고 도전적인 비디오 데이터에 대한 일반화 성능을 어떻게 향상시키는가?

주요 결과

  • Pillar Networks++는 HMDB-51 데이터셋에서 최상위 1위 정확도 73.6%를 달성하여 새로운 최신 기준 성능을 수립했다.
  • 수작업 특징 추출을 사용한 이전 최신 기준 방법들보다 1.4%포인트 높은 성능을 기록했다.
  • Inception 및 ResNet 네트워크에서 유도된 딥 특징에만 의존함으로써 수작업 특징 추출이 필요 없어졌다.
  • PoE 프레임워크를 통한 불확실성 추정치 통합은 다양한 비디오 조건에서 더 신뢰할 수 있고 캘리브레이션된 예측을 이끌어냈다.
  • 분산형 GP 아키텍처는 수평적 확장성을 제공하여 시스템 전체를 재학습하지 않고도 새로운 네트워크 전문가를 모듈러하게 추가할 수 있었다.
  • 고품질, 시점 및 운동의 변동성이 큰 도전적인 비디오 데이터에 대해서도 강력한 일반화 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.