Skip to main content
QUICK REVIEW

[논문 리뷰] Video Action Recognition Via Neural Architecture Searching

Wei Peng, Xiaopeng Hong|arXiv (Cornell University)|2019. 07. 10.
Human Pose and Action Recognition참고 문헌 22인용 수 4
한 줄 요약

이 논문은 비디오 동작 인식을 위한 최초의 신경망 아키텍처 탐색(NAS) 프레임워크를 제안하며, 스파티오템포럴 아키텍처를 효율적으로 탐색하기 위해 의사3D 연산자를 사용한 유연하고 연속적인 탐색 공간을 방향성 비순환 그래프(DAG)로 모델링한다. 이 방법은 0.67M 파라미터로 UCF101에서 58.6%의 정확도를 달성하여, 79M 파라미터를 가진 더 큰 수작업 설계 모델인 3D-ConvNet보다 7% 높은 정확도를 기록했으며, 파라미터 수는 약 1%에 불과하다.

ABSTRACT

Deep neural networks have achieved great success for video analysis and understanding. However, designing a high-performance neural architecture requires substantial efforts and expertise. In this paper, we make the first attempt to let algorithm automatically design neural networks for video action recognition tasks. Specifically, a spatio-temporal network is developed in a differentiable space modeled by a directed acyclic graph, thus a gradient-based strategy can be performed to search an optimal architecture. Nonetheless, it is computationally expensive, since the computational burden to evaluate each architecture candidate is still heavy. To alleviate this issue, we, for the video input, introduce a temporal segment approach to reduce the computational cost without losing global video information. For the architecture, we explore in an efficient search space by introducing pseudo 3D operators. Experiments show that, our architecture outperforms popular neural architectures, under the training from scratch protocol, on the challenging UCF101 dataset, surprisingly, with only around one percentage of parameters of its manual-design counterparts.

연구 동기 및 목표

  • 비디오 동작 인식을 위한 고성능 스파티오템포럴 신경망 아키텍처의 자동 설계를 통해 전문가 기반 설계 의존도를 줄이기.
  • 비디오 작업에서 NAS의 높은 계산 비용 문제를 해결하기 위해 시간 분할 전략과 효율적인 의사3D 연산자를 도입하기.
  • 지속적인 공간에서 엔드 투 엔드로 가능한 연속적인 아키텍처 탐색을 통해 기울기 기반 최적화를 허용하기.
  • 매우 작은 모델 크기로도 최신 기술 성능을 달성하기 위한 훈련에서부터 시작하는 프로토콜 하에서 최고의 성능을 내기.

제안 방법

  • 각 간선이 후보 연산자 집합과 연결된 방향성 비순환 그래프(DAG)로 탐색 공간을 모델링하며, 연산자 선택은 학습 가능한 아키텍처 파라미터 α를 통해 연속적으로 이루어진다.
  • 프록시리스 탐색 전략을 사용: 공유된 가중치를 가진 얕은 네트워크를 훈련시켜 아키텍처 성능를 평가함으로써 재훈련의 고비용을 피한다.
  • 계산량을 줄이면서도 전반적인 비디오 컨텍스트를 유지하기 위해, Ns=4개의 세그먼트와 세그먼트당 Nr=2개의 무작위 코너를 가지는 TSN 유사 입력 처리 방식을 도입한다.
  • 공간적 및 시간적 연산을 분리함으로써 효율성을 높이기 위해, 공간적 및 시간적 연산을 분리하는 의사3D 연산자(예: 디프웨이즈 분리형 컨벌루션, 확장 컨벌루션)를 탐색 공간에 적용한다.
  • 아키텍처 파라미터 α에 대해 소프트맥스를 적용하여 각 노드당 상위 2개의 연결과 각 연결에 가장 중요한 연산자를 선택함으로써 이산적이고 최종적인 아키텍처를 구성한다.
  • 깊이=6, 입력 해상도 112×112, 600 에포크 동안 코즈인 감소 학습률 스케줄을 사용하여 검색된 아키텍처를 기반으로 최종 네트워크를 훈련한다.

실험 결과

연구 질문

  • RQ1신경망 아키텍처 탐색이 비디오 동작 인식에 효과적으로 적용될 수 있는가? 즉, 스파티오템포럴 아키텍처의 자동 설계가 가능한가?
  • RQ2비디오 모델의 NAS에서 계산 비용을 성능 손실 없이 어떻게 줄일 수 있는가?
  • RQ3의사3D 연산자를 사용한 연속적인 탐색 공간에서의 기울기 기반 최적화가 수작업 설계보다 더 나은 아키텍처를 도출할 수 있는가? 특히 더 적은 파라미터로도 말이다.
  • RQ4제안된 방법이 표준 벤치마크에서 수작업 설계 모델보다 훈련에서부터 시작하는 조건에서 우수한 성능을 내는가?

주요 결과

  • 제안된 NAS 방법은 UCF101 스플릿 1에서 58.6%의 상위-1 정확도를 달성하여, 0.67M 파라미터로도 3D-ConvNet(51.6%)보다 7% 높은 정확도를 기록했다.
  • 검색된 아키텍처는 3D-ConvNet(79M 파라미터)의 약 1% 크기이며, 이는 모델 크기의 극적인 감소와 함께 높은 정확도 향상을 동시에 달성한 것을 의미한다.
  • 이 방법은 이미지넷 사전 훈련 없이도 훈련에서부터 시작하는 프로토콜 하에서 최신 기술 성능을 달성했다.
  • 검색 과정은 단일 V100 GPU에서 25시간 내로 완료되어 실용적 구현에 적합하다.
  • 최종 아키텍처는 확장 및 디프웨이즈 분리형 컨벌루션과 같은 더 큰 수감 필드를 가지는 연산자를 선호함으로써 효과적인 인덕티브 바이어스 학습이 이루어졌음을 시사한다.
  • 성능 향상은 다양한 평가 지표에서 일관되게 나타나, 검색된 모델은 정확도와 파라미터 효율성 측면에서 3D-ResNet18, 3D-ResNet101, STC-ResNet 변종보다 뚜렷이 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.