Skip to main content
QUICK REVIEW

[논문 리뷰] Compressed Video Action Recognition with Refined Motion Vector

Haoyuan Cao, Shining Yu|arXiv (Cornell University)|2019. 10. 06.
Human Pose and Action Recognition참고 문헌 27인용 수 8
한 줄 요약

이 논문은 압축 영상에서 유해한 움직임 벡터를 개선함으로써 압축 영상 행동 인식 성능을 햖스키기 위한 정교화된 운동 벡터 방법을 제안한다. 영상 압축 코덱에서 유도된 노이즈가 많은 운동 벡터를 보완하고, 더 효율적이고 정확한 대안으로 광학 흐름을 대체한다. 이 방법은 최소한의 계산 오버헤드로 UCF-101과 HMDB-51에서 최신 기술 수준(SOTA) 성능을 달성하며, 원래의 CoViAR 프레임워크보다 서브넷을 세 개에서 두 개로 줄여도 성능이 뛰어나다.

ABSTRACT

Although CNN has reached satisfactory performance in image-related tasks, using CNN to process videos is much more challenging due to the enormous size of raw video streams. In this work, we propose to use motion vectors and residuals from modern video compression techniques to effectively learn the representation of the raw frames and greatly remove the temporal redundancy, giving a faster video processing model. Compressed Video Action Recognition(CoViAR) has explored to directly use compressed video to train the deep neural network, where the motion vectors were utilized to present temporal information. However, motion vector is designed for minimizing video size where precise motion information is not obligatory. Compared with optical flow, motion vectors contain noisy and unreliable motion information. Inspired by the mechanism of video compression codecs, we propose an approach to refine the motion vectors where unreliable movement will be removed while temporal information is largely reserved. We prove that replacing the original motion vector with refined one and using the same network as CoViAR has achieved state-of-art performance on the UCF-101 and HMDB-51 with negligible efficiency degrades comparing with original CoViAR.

연구 동기 및 목표

  • 영상 압축에서의 열악한 운동 벡터 품질 문제를 해결하기 위해, 행동 인식에 부적합한 노이즈가 많은 운동 벡터를 개선한다.
  • 시간 정보를 유지하면서 신뢰할 수 없는 운동 성분을 제거하는 방식으로 운동 벡터를 정교화하는 방법을 개발한다.
  • 압축 영상 데이터를 기반으로 광학 흐름의 경량이고 효율적인 대체 방법을 제안한다.
  • 지나친 속도 저하 없이 기존의 압축 영상 행동 인식 방법보다 더 높은 정확도를 달성한다.

제안 방법

  • 신뢰도 맵 임계치 기반 기법을 적용하여 불안정한 운동 성분을 억제함으로써 운동 벡터를 정교화한다.
  • ResNet-18 기반의 정교화 네트워크를 활용해 운동 벡터를 처리하고 정교화된 운동 표현을 생성한다.
  • 정교화된 운동 벡터를 이중 스트림 행동 인식 모델의 입력으로 사용하여 광학 흐름을 대체한다.
  • 원본 영상 프레임이 필요 없이 기존의 압축 영상 데이터(운동 벡터 및 잔여량)만을 활용한다.
  • 노이즈 제거와 동시에 시간적 일관성을 유지하도록 설계되어, 광학 흐름의 행동을 모방한다.
  • CoViAR와 동일한 네트워크 아키텍처를 사용하여 공정한 비교가 가능하도록 평가한다.

실험 결과

연구 질문

  • RQ1압축 영상에서 유도된 정교화된 운동 벡터는 원본 운동 벡터보다 더 높은 행동 인식 성능을 달성할 수 있는가?
  • RQ2오직 압축 영상 데이터만을 사용할 때, 운동 벡터를 정교화하는 것이 광학 흐름 기반 방법보다 정확도 향상에 기여하는가?
  • RQ3정교화된 운동 벡터 방법은 정확도 향상과 함께 높은 추론 속도를 유지할 수 있는가?
  • RQ4세 스트림 융합 구조(운동 벡터 + 잔여량)를 사용하는 것보다 정교화된 운동 벡터 방법이 더 효율적인가?
  • RQ5더 깊은 네트워크를 사용할 경우 정교화된 운동 벡터 기반 방법의 성능 향상이 더 크게 나타나는가?

주요 결과

  • 정교화된 운동 벡터 방법은 HMDB-51에서 평균 3개의 스플릿을 기준으로 테스트 정확도 59.69%를 달성했으며, 세 개의 네트워크 융합을 사용한 원래의 CoViAR 방법(59.1%)보다 뛰어난 성능을 보였다.
  • UCF-101에서 정교화된 운동 벡터 접근법은 CoViAR에 비해 효율성 저하가 최소한이면서도 최신 기술 수준 성능을 달성했다.
  • 정교화된 운동 벡터를 사용한 두 서브넷(정교화된 mv + I-프레임)이 HMDB-51에서 원래의 CoViAR의 세 서브넷 융합(운동 벡터 + I-프레임 + 잔여량)보다 정확도가 높았다.
  • 정교화된 운동 벡터 서브넷이 원래 CoViAR의 잔여량 서브넷보다 정확도 향상에 더 효과적이었으며, 이는 더 유용한 특징 표현임을 시사한다.
  • 정교화된 운동 벡터 서브넷에 ResNet-34를 사용할 경우 HMDB-51 스플릿1에서 정확도가 1.5% 향상되었으며, 깊이에 따른 확장 가능성을 입증했다.
  • 메서드는 거의 무시할 수 없는 속도 손실만을 겪었으며, UCF-101에서 프레임당 486fps로 처리했고, CoViAR의 500fps와 비교해도 큰 손실이 없어 자원이 제한된 환경에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.