Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Gating ConvNet for Two-Stream based Methods in Action Recognition

Jiagang Zhu, Wei Zou|arXiv (Cornell University)|2017. 09. 12.
Human Pose and Action Recognition참고 문헌 11인용 수 5
한 줄 요약

이 논문은 두 번째 스트림 동작 인식에서 적응형 융합을 위한 엔드 투 엔드로 훈련 가능한 게이팅 컨볼루션 네트워크를 제안한다. 고정 평균화 대신 ReLU 활성화를 사용한 융합 가중치를 사용한다. 다중 작업 학습을 통해 융합 가중치와 동작 분류를 동시에 학습함으로써, UCF101에서 94.5%의 정확도를 달성하여 고정 가중치 방법을 능가한다. 이는 각 비디오에 대해 더 신뢰할 만한 스트림에 더 높은 신뢰도를 동적으로 할당함으로써 가능하다.

ABSTRACT

For the two-stream style methods in action recognition, fusing the two streams' predictions is always by the weighted averaging scheme. This fusion method with fixed weights lacks of pertinence to different action videos and always needs trial and error on the validation set. In order to enhance the adaptability of two-stream ConvNets and improve its performance, an end-to-end trainable gated fusion method, namely gating ConvNet, for the two-stream ConvNets is proposed in this paper based on the MoE (Mixture of Experts) theory. The gating ConvNet takes the combination of feature maps from the same layer of the spatial and the temporal nets as input and adopts ReLU (Rectified Linear Unit) as the gating output activation function. To reduce the over-fitting of gating ConvNet caused by the redundancy of parameters, a new multi-task learning method is designed, which jointly learns the gating fusion weights for the two streams and learns the gating ConvNet for action classification. With our gated fusion method and multi-task learning approach, a high accuracy of 94.5% is achieved on the dataset UCF101.

연구 동기 및 목표

  • 비디오 간 공간적 및 시간적 콘텐츠의 다양성에 대응하지 못하는 두 번째 스트림 컨볼루션 네트워크의 고정 가중치 융합의 한계를 해결한다.
  • 양쪽 스트림의 입력 특징에서 유도된 인스턴스별 융합 가중치를 학습함으로써 모델의 적응성을 향상시킨다.
  • 융합 가중치와 동작 분류를 동시에 최적화하는 새로운 다중 작업 학습 전략을 통해 게이팅 네트워크의 과적합을 줄인다.
  • 게이팅 메커니즘의 엔드 투 엔드 훈련을 가능하게 하여 행동 인식 벤치마크에서 일반화 능력과 성능을 향상시킨다.

제안 방법

  • 공간적 및 시간적 스트림의 동일 레이어에서 연결된 특징 맵을 입력으로 사용하는 게이팅 컨볼루션 네트워크를 도입한다.
  • 공간적 및 시간적 스트림에 대한 두 개의 음이 아닌 융합 가중치를 생성하기 위해 출력 활성화 함수로 ReLU를 사용한다.
  • 융합 가중치와 동작 분류를 동시에 훈련하는 다중 작업 학습 프레임워크를 설계한다.
  • 예측 수준에서 게이팅 컨볼루션 네트워크를 적용하여 고정 평균화 대신 각 비디오 샘플에 대해 학습된 적응형 융합을 대체한다.
  • 게이팅 네트워크 입력으로서 연결 및 컨볼루션 융합을 포함한 다양한 입력 구성 방식을 탐색한다.
  • 융합 및 분류 목표를 공동 최적화하는 표준 backpropagation를 사용하여 전체 시스템을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1게이팅 네트워크를 통해 학습된 적응형 융합 가중치가 고정 가중치 평균화를 초월하여 두 번째 스트림 동작 인식 성능을 향상시킬 수 있는가?
  • RQ2게이팅 출력 활성화 함수로 Softmax 대신 ReLU를 사용할 경우 수렴 속도가 빨라지고 성능이 향상되는가?
  • RQ3융합 가중치와 동작 분류의 공동 학습이 게이팅 네트워크의 일반화 능력을 향상시키고 과적합을 줄이는가?
  • RQ4학습된 융합 가중치의 분포가 다양한 비디오 클래스와 입력 유형 간에 어떻게 달라지는가?
  • RQ5제안된 방법이 UCF101과 같은 표준 벤치마크에서 top-1 및 top-5 정확도를 어느 정도 향상시키는가?

주요 결과

  • 제안된 게이팅 융합 방법은 UCF101에서 top-1 정확도 94.5%를 달성하여 고정 가중치 평균화 방법을 능가한다.
  • 게이팅 네트워크에서 ReLU를 사용할 경우 Softmax 기반 게이팅 대비 더 빠른 수렴과 경쟁 가능한 최종 정확도를 달성한다.
  • 다중 작업 학습은 융합 가중치에 대한 적응형 선택 공간을 넓혀 더 동적이고 맥락 인식 가능한 융합 결정을 가능하게 한다.
  • t-SNE 시각화 결과, 동작 분류와 함께 공동으로 훈련된 게이팅 컨볼루션 네트워크의 특징이 더 분류 용이해짐을 확인할 수 있다.
  • 한 스트림이 신뢰할 수 없을 경우 모델은 더 정확한 스트림에 더 높은 가중치를 할당함으로써 예측의 신뢰도와 정확도를 향상시킨다.
  • 고정 융합 가중치를 수동으로 설정하기 위한 수기 검증 세트 시험을 제거함으로써 하이퍼파ram터 튜닝에 대한 의존도를 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.