Skip to main content
QUICK REVIEW

[논문 리뷰] ActionFlowNet: Learning Motion Representation for Action Recognition

Joe Yue-Hei Ng, Jonghyun Choi|arXiv (Cornell University)|2016. 12. 09.
Human Pose and Action Recognition참고 문헌 27인용 수 9
한 줄 요약

ActionFlowNet는 원시 영상 픽셀에서 직접 동작을 인식하고 광학 흐름을 추정하는 단일 스트림 컨volution 네트워크를 공동으로 훈련하는 다중작업 학습 프레임워크를 제안한다. 외부 사전 훈련이나 광학 흐름 입력 없이도 최신 비지도 학습 방법보다 동작 인식 정확도를 23.6% 향상시킨다. 레이블이 제한된 데이터만으로도 ImageNet 사전 훈련 모델과 경쟁 가능한 성능을 달성한다.

ABSTRACT

Even with the recent advances in convolutional neural networks (CNN) in various visual recognition tasks, the state-of-the-art action recognition system still relies on hand crafted motion feature such as optical flow to achieve the best performance. We propose a multitask learning model ActionFlowNet to train a single stream network directly from raw pixels to jointly estimate optical flow while recognizing actions with convolutional neural networks, capturing both appearance and motion in a single model. We additionally provide insights to how the quality of the learned optical flow affects the action recognition. Our model significantly improves action recognition accuracy by a large margin 31% compared to state-of-the-art CNN-based action recognition models trained without external large scale data and additional optical flow input. Without pretraining on large external labeled datasets, our model, by well exploiting the motion information, achieves competitive recognition accuracy to the models trained with large labeled datasets such as ImageNet and Sport-1M.

연구 동기 및 목표

  • 최소한의 감독 하에 효과적인 영상 표현을 학습함으로써 동작 인식에서 레이블이 부족한 영상 데이터 문제를 해결한다.
  • 대규모 데이터셋이 있음에도 불구하고 운동 특징를 효과적으로 학습하지 못하는 분류 전용 훈련의 한계를 극복한다.
  • 단일 엔드 투 엔드 네트워크에서 운동과 외관 표현을 공동으로 학습함으로써 수작업으로 만든 광학 흐름 입력의 필요성을 제거한다.
  • 다중작업 학습을 통해 광학 흐름 추정과 함께 학습된 운동 표현이 레이블이 제한된 데이터에서 동작 인식 정확도를 크게 향상시킬 수 있음을 보여준다.

제안 방법

  • 원시 영상 프레임에서 광학 흐름 추정과 동작 인식을 동시에 수행하는 단일 스트림 3D 컨volution 신경망(ActioFlowNet)을 제안한다.
  • 두 가지 손실 함수를 사용한 다중작업 학습을 통해 네트워크를 훈련한다: 분류를 위한 교차 엔트로피 손실과 광학 흐름 추정을 위한 L2 손실.
  • 스패티오-타임스페이셜 특징를 모델링하기 위해 3D 컨볼루션을 사용한 ResNet 기반 아키텍처를 통합하며, 두 작업 간에 특징를 공유한다.
  • 원시 픽셀에서 레이블이 있는 동작 분류만으로 감독을 받고, 광학 흐름 추정을 보조 작업으로 활용하여 운동 표현 학습을 이끌어내는 엔드 투 엔드 훈련을 수행한다.
  • 다른 데이터셋(FlyingChairs 대비 UCF101)에서 별도의 광학 흐름 헤드를 훈련하여 흐름 품질이 인식 성능에 미치는 영향을 평가하고 일반화 능력을 분석한다.
  • 흐름 스트림은 고정하고 분류 헤드만 미세조정하는 스택드 아키텍처를 사용하여 흐름 품질이 인식 성능에 미치는 영향을 분리하여 분석한다.

실험 결과

연구 질문

  • RQ1원시 픽셀에서 광학 흐름과 동작 인식을 공동으로 학습함으로써 외부 사전 훈련 없이도 동작 인식 성능을 향상시킬 수 있는가?
  • RQ2학습된 광학 흐름의 품질이 하류 동작 인식 정확도에 미치는 영향은 어떠한가? 특히 표준 벤치마크에서 EPE로 측정했을 때의 영향은?
  • RQ3작은 이동 거리가 있는 데이터셋(예: UCF101)에서 훈련한 흐름 네트워크가 큰 이동 거리가 있는 데이터셋(예: FlyingChairs)에서 훈련한 것보다 더 나은 동작 인식 성능을 낼 수 있는가? (EPE는 더 높지만)
  • RQ4원시 픽셀에서 운동 표현을 엔드 투 엔드로 학습하는 것이 수작업으로 만든 광학 흐름이나 사전 훈련된 특징에 의존하는 모델보다 얼마나 더 우수한가?

주요 결과

  • ActionFlowNet는 외부 데이터나 광학 흐름 입력을 사용하지 않는 최신 비지도 표현 학습 방법보다 23.6% 높은 동작 인식 정확도를 달성한다.
  • 모델은 사전 훈련 없이 UCF101에서 69.6%의 Top-1 정확도를 기록했으며, Sports-1M에서 미세조정한 C3D보다 1.6% 높다.
  • EPE가 더 높은 편(11.84 대비 9.12)에도 불구하고, UCF101에서 훈련한 모델은 FlyingChairs에서 훈련한 모델(51.7%)보다 훨씬 높은 동작 인식 성능(69.6%)을 보이며, 이는 EPE와 같은 흐름 품질 지표가 항상 인식 성능과 상관되지 않는다는 것을 시사한다.
  • 운동 패턴이 단순하고 구분 가능한 동작(예: WallPushups, ApplyEyeMakeup)에서 모델의 성능이 가장 뛰어나다.
  • 고품질 광학 흐름(EpicFlow, EPE=6.29)을 사용하더라도 모델의 인식 정확도(77.7%)는 광학 흐름으로 직접 훈련된 모델에 비해 낮아, 엔드 투 엔드로 학습된 흐름의 품질에 한계가 있음을 시사한다.
  • 정성적 분석 결과, FlyingChairs에서 훈련한 모델는 작은 이동을 정확히 추정하지 못하며 배경 영역에서 아티팩트를 생성하여, 낮은 EPE에도 불구하고 인식 성능에 악영향을 준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.