Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Motion Representation: Residual Frames with 3D ConvNets for Better Action Recognition

Tao Li, Xueting Wang|arXiv (Cornell University)|2020. 01. 16.
Human Pose and Action Recognition참고 문헌 32인용 수 19
한 줄 요약

이 논문은 동작 인식을 위한 운동 특징 추출을 향상시키기 위해 정적 배경과 물체가 제거된 잔차 프레임(Residual frames)을 3D ConvNets의 입력으로 사용하는 방법을 제안한다. 표준 RGB 프레임 대신 잔차 프레임을 사용함으로써, 훈련을 처음부터 시작할 경우 UCF101과 HMDB51에서 각각 20.5% 및 12.5%의 상위 1위 정확도 향상을 달성하였으며, 잔차 기반 운동 특징과 2D 컨볼루션된 외관 특징을 조합한 이중 경로 네트워크는 비용이 많이 드는 광학 흐름 계산을 필요로 하지 않으면서도 광학 흐름 기반 모델을 능가하는 성능을 보였다.

ABSTRACT

Recently, 3D convolutional networks yield good performance in action recognition. However, optical flow stream is still needed to ensure better performance, the cost of which is very high. In this paper, we propose a fast but effective way to extract motion features from videos utilizing residual frames as the input data in 3D ConvNets. By replacing traditional stacked RGB frames with residual ones, 20.5% and 12.5% points improvements over top-1 accuracy can be achieved on the UCF101 and HMDB51 datasets when trained from scratch. Because residual frames contain little information of object appearance, we further use a 2D convolutional network to extract appearance features and combine them with the results from residual frames to form a two-path solution. In three benchmark datasets, our two-path solution achieved better or comparable performances than those using additional optical flow methods, especially outperformed the state-of-the-art models on Mini-kinetics dataset. Further analysis indicates that better motion features can be extracted using residual frames with 3D ConvNets, and our residual-frame-input path is a good supplement for existing RGB-frame-input models.

연구 동기 및 목표

  • 비용이 많이 드는 광학 흐름 계산에 의존하지 않고도 3D ConvNets의 운동 표현을 향상시키기 위해.
  • 잔차 프레임(운동 변화만 포함)이 표준 RGB 프레임 스택보다 시간적 동역학을 더 잘 포착할 수 있는지 조사하기 위해.
  • 잔차 기반 운동 특징과 단일 RGB 프레임에서 유도된 외관 특징을 조합한 이중 경로 네트워크를 개발하여 인식 성능 향상시키기 위해.
  • 잔차 프레임 입력이 RGB 전용 3D ConvNets보다 훈련을 처음부터 시작할 경우 상당한 정확도 향상을 이끌 수 있음을 입증하기 위해.
  • 광학 흐름을 사용하는 이중 경로 모델에 비해 계산 비용이 적게 들면서도 유사하거나 더 높은 성능을 달성하는 효율적인 대안을 제공하기 위해.

제안 방법

  • 연속된 RGB 프레임 간의 차이를 계산하여 정적 배경과 물체 외관을 억제하고 운동 변화만을 고립시키는 방식으로 잔차 프레임을 생성한다.
  • 표준 RGB 프레임 스택 대신 스택된 잔차 프레임을 3D ConvNet의 입력으로 사용하여 운동 특징을 추출한다.
  • 단일 RGB 프레임을 사용하여 별도의 2D ConvNet을 훈련시켜 외관 특징을 추출하고, 이를 보완 경로로 활용한다.
  • 3D 잔차 경로와 2D 외관 경로의 특징을 후기 융합(fusion) 방식으로 융합하여 인식 정확도를 향상시킨다.
  • 3D 운동 경로의 백본으로 ResNet-18을 사용하고, 외관 경로로 표준 2D ConvNet을 사용하여 계산 효율성을 확보한다.
  • 교차 엔트로피 손실을 사용하여 최상위 1위 및 최상위 5위 정확도를 최적화하는 방식으로, 벤치마크 데이터셋에서 이중 경로 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1잔차 프레임이 3D ConvNets의 동작 인식에서 표준 RGB 프레임 스택보다 더 효과적인 입력으로 기능할 수 있는가?
  • RQ2잔차 프레임으로 광학 흐름을 대체할 경우, 상당히 감소된 계산 비용으로도 유사하거나 더 높은 성능을 달성할 수 있는가?
  • RQ3잔차 기반 운동 특징과 RGB 기반 외관 특징을 조합한 이중 경로 네트워크가 기존의 이중 경로 모델을 능가할 수 있는가?
  • RQ4UCF101, HMDB51, Mini-kinetics와 같은 다양한 복잡도의 데이터셋에서 잔차 프레임 방법의 성능가 어떻게 스케일링되는가?
  • RQ5잔차 프레임 방법은 전역 운동과 미세한 물체 상호작용을 포함한 복잡한 동작에 대해 강건한가?

주요 결과

  • 3D ConvNets에 잔차 프레임을 입력으로 사용함으로써, 훈련을 처음부터 시작할 경우 UCF100에서 상위 1위 정확도가 20.5% 향상되었고, HMDB51에서는 12.5% 향상되었다.
  • 이중 경로 모델은 UCF101에서 90.6%의 상위 1위 정확도, Mini-kinetics에서는 73.9%를 기록하여, 광학 흐름 없이도 MARS 및 TBN과 같은 최신 기술 수준의 모델을 능가했다.
  • HMDB51에서 이중 경로 모델은 상위 1위 정확도 55.4%를 기록하여, 최고 성능을 내는 이중 경로 모델과 동일한 성능을 달성했지만, 광학 흐름을 필요로 하지 않았다.
  • 운동 경로만으로도 UCF101에서 87.0%의 상위 1위 정확도를 달성하여, RGB 입력만을 사용하는 TSN 및 I3D-RGB를 뛰어넘었다.
  • 이중 경로 모델은 UCF101에서 상위 5위 정확도 98.6%를 기록하여, 광학 흐름을 사용하는 원본 이중 경로 모델을 능가했다.
  • 더 얕은 3D 백본(ResNet-18)을 사용했음에도 불구하고, 더 깊은 모델인 ResNeXt-101-3D에 비해 성능이 열등하지 않으며, RGB 및 흐름 스트림을 조합한 MARS를 초월하는 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.