Skip to main content
QUICK REVIEW

[논문 리뷰] Hallucinating Optical Flow Features for Video Classification

Yongyi Tang, Lin Ma|arXiv (Cornell University)|2019. 05. 28.
Advanced Image Processing Techniques참고 문헌 31인용 수 3
한 줄 요약

이 논문은 계산 비용이 높은 광학 흐름 추정에 의존하지 않고 외관 특징에서 광학 흐름 특징을 생성하는 모션 환각 네트워크인 MoNet을 제안한다. 시간적 및 맥락적 관계를 동시에 모델링함으로써, MoNet은 이중 스트림 영상 분류에서 최대 50% 감소한 FLOPs와 저장 용량을 달성하면서 Kinetics-400 및 YouTube-8M에서 일관된 성능 향상을 이끌어내며 진정한 광학 흐름과 비교해 정확도 저하가 최소한이 된다.

ABSTRACT

Appearance and motion are two key components to depict and characterize the video content. Currently, the two-stream models have achieved state-of-the-art performances on video classification. However, extracting motion information, specifically in the form of optical flow features, is extremely computationally expensive, especially for large-scale video classification. In this paper, we propose a motion hallucination network, namely MoNet, to imagine the optical flow features from the appearance features, with no reliance on the optical flow computation. Specifically, MoNet models the temporal relationships of the appearance features and exploits the contextual relationships of the optical flow features with concurrent connections. Extensive experimental results demonstrate that the proposed MoNet can effectively and efficiently hallucinate the optical flow features, which together with the appearance features consistently improve the video classification performances. Moreover, MoNet can help cutting down almost a half of computational and data-storage burdens for the two-stream video classification. Our code is available at: https://github.com/YongyiTang92/MoNet-Features.

연구 동기 및 목표

  • 이중 스트림 영상 분류에서 광학 흐름 추정의 높은 계산 및 저장 비용을 제거하기 위해.
  • 광학 흐름 계산에 의존하지 않고 외관 특징에서 운동 표현을 환각하는 방법을 개발하기 위해.
  • 외관 특징와 보완하는 환각된 광학 흐름 특징을 사용하여 이중 스트림 영상 분류 성능을 향상시키기 위해.
  • 광학 흐름 추출 및 특징 추출 파이프라인을 건너뛰어 대규모 영상 분류를 효율적으로 가능하게 하기 위해.

제안 방법

  • MoNet은 외관 특징의 시간적 의존성을 동시에 모델링하고 광학 흐름 특징의 맥락적 관계를 동시에 모델링하는 동시 아키텍처를 사용한다.
  • 네트워크는 시간적 및 공간적 맥락을 통해 정보를 전파하기 위해 순환적 확장과 잔차 연결을 활용한다.
  • 특징 환각을 시퀀스에서 시퀀스로의 번역 문제로 공식화하여, 개선된 맥락 집약을 갖춘 RNN 유사 장거리 모델링을 활용한다.
  • 모델은 I3D로 추출한 외관 특징 및 광학 흐름 특징을 사용하여 Kinetics-400에서 사전 훈련한 후 YouTube-8M로 전이된다.
  • 환각된 광학 흐름 특징은 이중 스트림 분류 아키텍처에서 외관 특징과 융합된다.
  • 학습된 변환을 통해 외관 특징에서 직접적으로 운동 특징을 생성함으로써 광학 흐름 계산과 저장을 피하는 방법을 사용한다.

실험 결과

연구 질문

  • RQ1명시적인 광학 흐름 계산 없이 외관 특징에서 광학 흐름 특징을 효과적으로 환각할 수 있는가?
  • RQ2일반적인 RNN보다 동시 모델링 접근 방식이 복잡한 운동 표현을 영상 분류에서 더 잘 포착할 수 있는가?
  • RQ3환각된 광학 흐름 특징는 계산 및 저장 비용을 줄이면서 이중 스트림 영상 분류 정확도를 어느 정도 향상시킬 수 있는가?
  • RQ4환각된 운동 표현은 YouTube-8M와 같은 대규모 영상 데이터셋에 얼마나 잘 일반화되는가?

주요 결과

  • 환각된 이중 스트림 모델은 선형 분류기로 Kinetics-400에서 71.32%의 Top-1 정확도를 달성했으며, NeXtVLAD를 사용할 경우 72.40%에 이를 정도로 단일 스트림 외관 모델보다 일관되게 향상되었다.
  • YouTube-8M에서 환각된 이중 스트림 모델은 Hit@1 88.62%, GAP@20 80.41%, MAP@20 79.39%, PERR 46.79%를 기록하여 모든 지표에서 단일 외관 스트림보다 뛰어난 성능을 보였다.
  • 계산 비용은 실제 광학 흐름을 사용할 경우 425 GFLOPs에서 환각된 경우 224 GFLOPs로 감소하여 약 50% 감소하였다.
  • 광학 흐름 이미지를 저장할 필요가 없어져 약 50%의 데이터 저장 용량 절감이 이루어졌다.
  • 더 깊은 MoNet 아키텍처일수록 성능 향상이 이루어져 순환적 확장 전략의 효과성을 확인했다.
  • 환각된 광학 흐름 특징는 외관 특징와 보완하기에 충분히 표현력이 있어 진정한 광학 흐름을 사용한 모델과 비교해 약 2%의 정확도 저하만을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.