Skip to main content
QUICK REVIEW

[논문 리뷰] Non-local NetVLAD Encoding for Video Classification

Yongyi Tang, Xing Zhang|arXiv (Cornell University)|2018. 09. 29.
Human Pose and Action Recognition참고 문헌 28인용 수 9
한 줄 요약

이 논문은 YouTube-8M에서 비디오 분류를 위한 컴act한 단일 모델 시스템을 제안하며, 비국소 NetVLAD 인코딩을 사용한다. 비국소 블록을 NetVLAD와 통합하여 특징 표현을 향상시킨다. 모델 평균화, bfloat16 정밀도 양자화, 앙상블 기법을 활용하여 1GB 모델 크기 제약 조건 하에서 공개 테스트 세트에서 0.88763 GAP@20의 성능을 달성했으며, 제2회 YouTube-8M 챌린지에서 4위를 기록했다.

ABSTRACT

This paper describes our solution for the 2$^ ext{nd}$ YouTube-8M video understanding challenge organized by Google AI. Unlike the video recognition benchmarks, such as Kinetics and Moments, the YouTube-8M challenge provides pre-extracted visual and audio features instead of raw videos. In this challenge, the submitted model is restricted to 1GB, which encourages participants focus on constructing one powerful single model rather than incorporating of the results from a bunch of models. Our system fuses six different sub-models into one single computational graph, which are categorized into three families. More specifically, the most effective family is the model with non-local operations following the NetVLAD encoding. The other two family models are Soft-BoF and GRU, respectively. In order to further boost single models performance, the model parameters of different checkpoints are averaged. Experimental results demonstrate that our proposed system can effectively perform the video classification task, achieving 0.88763 on the public test set and 0.88704 on the private set in terms of GAP@20, respectively. We finally ranked at the fourth place in the YouTube-8M video understanding challenge.

연구 동기 및 목표

  • YouTube-8M 챌린지에서 1GB 모델 크기 제약 조건 하에 컴팩트한 단일 모델 비디오 분류 시스템을 개발하는 것.
  • 장거리 시간적 모델링을 향상시키기 위해 비국소 연산을 NetVLAD 풀링에 통합하여 비디오 특징 표현을 향상시키는 것.
  • 스토캐스틱 웨이트 평균화와 랜덤 특징 부분 추출을 통한 다중 추론을 활용하여 단일 모델 성능을 향상시키는 것.
  • bfloat16 파rameter 양자화와 계산 그래프 융합을 통해 1GB 제약 조건 내에서 효과적인 모델 앙상블을 가능하게 하는 것.
  • 중량이 무거운 앙상블에 의존하지 않고도 경쟁적인 성능을 달성하여 실세계 배포에 실용적인 시스템을 만드는 것.

제안 방법

  • 비디오 특징의 장거리 의존성을 포착하기 위해 NetVLAD 풀링 이후 비국소 블록을 스택하여 비국소 NetVLAD를 도입한다.
  • 기존 VLAD의 하드 클러스터링을 대체하기 위해 미분 가능 학습을 가능하게 하는 소프트 할당을 사용한다.
  • 정확도에 큰 영향을 주지 않으면서 모델 크기를 절반으로 줄일 수 있는 bfloat16 형식을 사용하여, 1GB 제약 조건 내에서 더 많은 앙상블을 가능하게 한다.
  • 여러 체크포인트에 걸친 선형 모델 평균화를 적용하여 개별 모델의 일반화 및 강건성을 향상시킨다.
  • 랜덤 특징 부분 추출을 통한 다중 전방 계산을 수행하고 예측을 평균화하여 성능을 향상시킨다.
  • LFNL-NetVLAD, LFNL-NetRVLAD, EFNL-NetVLAD, Soft-BoF-4k, Soft-BoF-8k, GRU의 여섯 개의 서브모델을 하나의 계산 그래프로 융합하여 추론을 수행한다.

실험 결과

연구 질문

  • RQ1비국소 연산은 대규모 비디오 분류를 위한 NetVLAD 기반 비디오 특징 인코딩에 효과적인가?
  • RQ2모델 평균화와 랜덤 부분 추출을 통한 반복 추론은 단일 모델 성능 향상에 얼마나 효과적인가?
  • RQ31GB 제약 조건 하에서 bfloat16 양자화가 성능 유지를 유지하면서 모델 크기를 얼마나 줄일 수 있는가?
  • RQ4다양한 아키텍처(비국소 NetVLAD, GRU, Soft-BoF)는 앙상블 환경에서 어떻게 상호보완적인가?
  • RQ5엄격한 크기 제약 조건 하에서 단일 컴팩트 모델이 앙상블 기반 접근법을 능가할 수 있는가?

주요 결과

  • 비국소 NetVLAD 모델은 동일한 설정 하에서 검증 세트에서 0.8702 GAP@20를 달성하였으며, 기존 NetVLAD(0.8698)를 略로 뛰어넘었다.
  • 모든 여섯 개의 서브모델을 통합한 최종 앙상블 모델은 검증 세트에서 0.8847 GAP@20, 공개 테스트 세트에서 0.88763 GAP@20의 성능을 기록했다.
  • 10회의 랜덤 런을 통한 반복 추론은 검증 세트에서 0.0005, 공개 테스트 세트에서 0.0005의 성능 향상을 가져왔다.
  • bfloat16를 사용함으로써 모델 크기가 절반으로 줄었으며, 이는 1GB 제약 조건 내에서 더 많은 서브모델을 포함할 수 있도록 했다.
  • 최종 제출 모델 크기는 995MB로, 1GB 이내에 머물러 있어 효과적인 압축과 최적화를 입증했다.
  • 시스템은 제2회 YouTube-8M 챌린지에서 4위를 기록하였으며, 많은 앙상블 기반 방법들을 능가하여 컴팩트한 단일 모델 설계의 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.