Skip to main content
QUICK REVIEW

[논문 리뷰] Im2Flow: Motion Hallucination from Static Images for Action Recognition

Ruohan Gao, Bo Xiong|arXiv (Cornell University)|2017. 12. 12.
Anomaly Detection Techniques and Applications참고 문헌 78인용 수 10
한 줄 요약

이 논문은 레이블이 없는 영상에서 학습한 운동 사전 지식을 활용하여 단일 정적 이미지에서 광학 흐름을 환영적으로 생성하는 Im2Flow를 제안한다. 새로운 흐름 인코딩을 갖춘 딥 인코더-디코더 네트워크를 사용하여, 두 개의 스트림 네트워크에서 외관 특징과 융합할 때 실감나는 운동 예측을 생성하며, 이는 UCF와 스탠포드-10을 포함한 일곱 개인 데이터셋에서 최신 기술 성능을 달성한다.

ABSTRACT

Existing methods to recognize actions in static images take the images at their face value, learning the appearances---objects, scenes, and body poses---that distinguish each action class. However, such models are deprived of the rich dynamic structure and motions that also define human activity. We propose an approach that hallucinates the unobserved future motion implied by a single snapshot to help static-image action recognition. The key idea is to learn a prior over short-term dynamics from thousands of unlabeled videos, infer the anticipated optical flow on novel static images, and then train discriminative models that exploit both streams of information. Our main contributions are twofold. First, we devise an encoder-decoder convolutional neural network and a novel optical flow encoding that can translate a static image into an accurate flow map. Second, we show the power of hallucinated flow for recognition, successfully transferring the learned motion into a standard two-stream network for activity recognition. On seven datasets, we demonstrate the power of the approach. It not only achieves state-of-the-art accuracy for dense optical flow prediction, but also consistently enhances recognition of actions and dynamic scenes.

연구 동기 및 목표

  • 정적 이미지에서 명시적인 운동 신호가 없기 때문에, 단일 스냅샷에서 유추된 타당한 미래 운동을 인식하는 데 도전하는 것.
  • 수천 개의 레이블이 없는 영상 클립에서 일반적인 운동 사전 지식을 학습하여 정적 이미지의 운동 환영을 안내하는 것.
  • 원본 이미지의 외관 특징과 환영된 광학 흐름을 보조 운동 신호로 융합하여 정적 이미지 행동 인식을 향상시키는 것.
  • 훈련 중에 볼 수 없는 동작에 대해서도 운동 환영이 인식 성능을 향상시킬 수 있음을 입증하는 것.

제안 방법

  • 단일 RGB 이미지를 조밀한 광학 흐름 맵으로 변환하도록 훈련된 컨volutional 인코더-디코더 네트워크를 사용하여 단기 동적 특성을 모델링한다.
  • 이미지 번역 작업에서 운동 벡터를 더 잘 표현하기 위해 새로운 광학 흐름 인코딩 기법을 도입한다.
  • 다양한 인간 및 물체의 운동을 캡처하기 위해, 정제되지 않은, 레이블이 없는 영상 클립의 대규모 컬렉션에서 운동 사전 지식을 학습한다.
  • 두 개의 스트림 CNN 아키텍처에서 환영된 흐름을 원본 이미지 외관과 융합하여 종단 간 행동 인식을 수행한다.
  • 운동 사전 지식 학습을 위한 영상 데이터를 사용하여 약한 지도 학습 방식으로 프레임워크를 훈련하고, 정적 이미지 인식 벤치마크에서 미세 조정한다.
  • 새로운 데이터셋, 특히 새로운 동작 클래스를 포함한 데이터셋에 대해 운동 환영 모델을 적응시키기 위해 전이 학습을 적용한다.

실험 결과

연구 질문

  • RQ1딥 네트워크가 영상 데이터만을 지도로 사용하여 단일 정적 이미지에서 타당한 미래 운동을 유추할 수 있는가?
  • RQ2환영된 운동이 정적 이미지 행동 인식 향상에 보조 신호로서 얼마나 효과적인가?
  • RQ3다양하고 레이블이 없는 영상에서 학습한 운동 사전 지식이 추론 시에 알려지지 않은 동작 카테고리에 일반화되는가?
  • RQ4훈련 영상에 테스트 이미지의 동작이 포함되어 있지 않은 경우에도 환영된 흐름이 인식 성능 향상에 기여하는가?
  • RQ5운동 환영의 성능가 지표로 실제 광학 흐름과 비교했을 때 어떻게 되는가?

주요 결과

  • Im2Flow는 정적 이미지에서 조밀한 광학 흐름 예측에 최신 기술 성능을 달성하며, 이전 방법들을 크게 앞서간다.
  • UCF101 데이터셋에서 BN-Inception를 사용할 경우 90.5%의 정확도를 기록하여 영상 기반 방법의 최신 기술 성능을 달성한다.
  • 스탠포드-10 데이터셋에서 두 개의 스트림 네트워크에 환영된 흐름을 추가하면, 외관 특징 전용 기준보다 정확도가 최대 3.9%p 향상된다.
  • 훈련 영상에 포함되지 않은 새로운 동작(예: 플라이스키를 던지는 것)에 대해서도 모델은 추론된 운동을 통해 의미 있는 성능 향상을 달성한다.
  • 정적-YUP++ 동적 환경 인식 벤치마크에서, 외관 특징 전용일 경우 정확도가 74.3%에서 유추된 운동을 사용할 경우 78.2%로 향상되어 자연 동적 환경으로의 일반화 능력을 입증한다.
  • 영상 데이터를 데이터 증강에만 사용하는 이전 방법보다 성능이 뛰어나며, 스탠포드-10에서 mAP 74.9%를 기록하여 가장 가까운 기준 모델의 50.2%를 상회한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.