Skip to main content
QUICK REVIEW

[논문 리뷰] Long-short Term Motion Feature for Action Classification and Retrieval

Zhenzhong Lan, Xuanchong Li|arXiv (Cornell University)|2015. 02. 13.
Human Pose and Action Recognition참고 문헌 23인용 수 6
한 줄 요약

이 논문은 다양한 길이의 영상 블록에서 국소 운동 기술자를 추출함으로써 영상 행동 분류 및 검색을 향상시키는 간단하면서도 효과적인 방법인 Long-Short Term Motion Feature (LSTMF)를 제안한다. 짧은, 중간 길이, 긴 시간적 세그먼트의 특징을 결합함으로써 고정 길이 블록 방법보다 빠른 및 느린 운동을 더 효과적으로 포착할 수 있으며, 기본 모델로 Improved Dense Trajectory (IDT)를 사용하여 HMDB51, Hollywood2, UCF50, Olympics Sports 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We propose a method for representing motion information for video classification and retrieval. We improve upon local descriptor based methods that have been among the most popular and successful models for representing videos. The desired local descriptors need to satisfy two requirements: 1) to be representative, 2) to be discriminative. Therefore, they need to occur frequently enough in the videos and to be be able to tell the difference among different types of motions. To generate such local descriptors, the video blocks they are based on must contain just the right amount of motion information. However, current state-of-the-art local descriptor methods use video blocks with a single fixed size, which is insufficient for covering actions with varying speeds. In this paper, we introduce a long-short term motion feature that generates descriptors from video blocks with multiple lengths, thus covering motions with large speed variance. Experimental results show that, albeit simple, our model achieves state-of-the-arts results on several benchmark datasets.

연구 동기 및 목표

  • 다양한 운동 속도를 가지는 동작을 표현하는 데 있어 고정 길이 영상 블록의 한계를 해결하기 위해.
  • 영상 분류 및 검색에서 국소 운동 기술자의 구분 능력과 표현 능력을 향상시키기 위해.
  • 기존 영상 기술자 방법에 아키텍처 변경 없이 적용 가능한 일반적인 향상 기법을 개발하기 위해.
  • 다양한 벤치마크 데이터셋에서 기술자들의 다중 척도 시간 풀링이 성능을 크게 향상시킨다는 것을 입증하기 위해.

제안 방법

  • 단일 고정 길이가 아닌 다양한 길이의 영상 블록(예: 15, 30, 45, 60, 75, 90 프레임)에서 국소 스페로타임프리컬 특징을 추출한다.
  • 각 영상에 대해 다양한 시간 범위를 가진 여러 영상 블록을 생성하며, 이는 공간적 및 시간적 일관성을 유지한다.
  • 각 블록에서 국소 기술자(HOF, MBH 등)를 추출한 후, 피라미드 집계 전략을 사용해 모든 블록 길이에 걸쳐 풀링한다.
  • 최종 표현은 모든 블록 크기의 특징을 조합함으로써 다양한 운동 속도를 가진 동작를 더 잘 커버할 수 있도록 한다.
  • 기본 프레임워크로 Improved Dense Trajectory (IDT)를 사용하며, 동일한 인코딩 및 풀링 파이프라인을 유지한다.
  • 이 방법은 플러그 앤 플레이 방식으로 설계되어, 기술자 기반 영상 표현 시스템이라면 어떤 것과도 호환된다.

실험 결과

연구 질문

  • RQ1다양한 척도의 시간적 블록 크기로 국소 운동 기술자의 표현 능력과 구분 능력이 영상 행동 인식에서 향상될 수 있는가?
  • RQ2짧고 긴 영상 세그먼트의 특징을 조합하면 운동 속도가 다양하게 변하는 데이터셋에서 성능 향상이 이루어지는가?
  • RQ3다양한 벤치마크 데이터셋에서 LSTMF의 성능이 고정 길이 블록 방법 및 최신 기술 수준의 접근법보다 어떻게 비교되는가?
  • RQ4블록 길이 선택이 특히 짧은 지속 시간의 영상에서 특징 커버리지와 모델 정확도에 어떤 영향을 미치는가?

주요 결과

  • LSTMF는 블록 길이 l=90일 때 HMDB51에서 평균 정확도 63.7%를 기록하여 이전 최신 기술 수준인 61.1%를 초월했다.
  • Hollywood2에서 LSTMF는 68.2% MAP를 달성하여 이전 최고 성능인 64.3%를 뛰어넘었다.
  • UCF50에서 LSTMF는 평균 정확도 93.7%를 기록하여 이전 최신 기술 수준인 91.2%를 초월했다.
  • Olympics Sports 데이터셋에서 LSTMF는 91.4% MAP를 기록하여 이전 최고 성능인 91.1%를 약간 상회했다.
  • LSTMF의 성능는 블록 길이가 증가함에 따라 일관되게 향상되어 다양한 데이터셋에서 뛰어난 안정성과 확장성을 보였다.
  • 이 방법은 특히 운동 속도 변동성이 높은 영상에서 다중 척도 블록 풀링이 기술자 품질을 크게 향상시킨다는 점을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.