[논문 리뷰] Learning Mid-level Words on Riemannian Manifold for Action Recognition
이 논문은 전역 정렬을 통해 조밀하게 추출된 저수준 특징에서 중위수 시각 어휘를 구성하고, 이를 리만 다양체(하위공간, 공분산, 가우시안 통계를 통한)에서 모델링하는 새로운 행동 인식 프레임워크를 제안한다. 타당한 성능을 달성하면서도 기존 중위수 방법보다 빠른 계산 속도를 보이는 유클리드 기반 인코딩 방법(BoVW, VLAD, FV)을 리만 다양체로 확장한다. YouTube, UCF50, HMDB51, ASLAN 데이터셋에서 최신 기술 수준(SoA) 성능을 기록한다.
Human action recognition remains a challenging task due to the various sources of video data and large intra-class variations. It thus becomes one of the key issues in recent research to explore effective and robust representation to handle such challenges. In this paper, we propose a novel representation approach by constructing mid-level words in videos and encoding them on Riemannian manifold. Specifically, we first conduct a global alignment on the densely extracted low-level features to build a bank of corresponding feature groups, each of which can be statistically modeled as a mid-level word lying on some specific Riemannian manifold. Based on these mid-level words, we construct intrinsic Riemannian codebooks by employing K-Karcher-means clustering and Riemannian Gaussian Mixture Model, and consequently extend the Riemannian manifold version of three well studied encoding methods in Euclidean space, i.e. Bag of Visual Words (BoVW), Vector of Locally Aggregated Descriptors (VLAD), and Fisher Vector (FV), to obtain the final action video representations. Our method is evaluated in two tasks on four popular realistic datasets: action recognition on YouTube, UCF50, HMDB51 databases, and action similarity labeling on ASLAN database. In all cases, the reported results achieve very competitive performance with those most recent state-of-the-art works.
연구 동기 및 목표
- 실제 행동 인식 시나리오에서의 큰 클래스 내 변동성과 고차원 영상 데이터를 다루기 위해.
- 기하학적 구조를 가진 중위수 시각 어휘를 도입하여 표현의 강건성과 분류 능력을 향상시키기 위해.
- 내재된 통계 다양성을 더 잘 포착하기 위해 중위수 특징을 리만 다양체에 모델링하기 위해.
- 표준 유클리드 인코딩 방법(BoVW, VLAD, FV)을 리만 공간으로 확장하여 영상 표현을 향상시키기 위해.
- 기존 중위수 표현 방법보다 낮은 계산 비용으로 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 모든 영상 간 의미적 대응을 확립하기 위해, 보편적인 GMM를 사용해 조밀하게 추출된 저수준 특징(HOG, HOF, MBH)을 전역 정렬한다.
- 정렬된 특징 그룹을 선형 하위공간(Grassmann), 공분산 행렬(SPD), 가우시안 분포의 세 가지 별도의 리만 다양체에서 중위수 어휘로 통계 모델링한다.
- 리만 기반 클러스터링을 위한 내재적 리만 코드북을 K-Karcher-means 클러스터링과 리만 기반 가우시안 혼합 모델을 통해 구축한다.
- 지오데식 거리와 리만 기반 기울기(gradient)를 사용해 세 가지 표준 인코딩 방법—시각 어휘의 망기둥(BoVW), 局부적으로 집계된 묘사자(VLAD), 피셔 벡터(FV)—를 리만 다양체로 확장한다.
- 다양한 중위수 어휘 표현(하위공간, 공분산, 가우시안)과 묘사자(HOG, HOF, MBH)를 융합하여 강건성을 향상시킨다.
- 최종 영상 표현을 선형 SVM에 입력하여 분류하고, 성능 향상을 위해 후기 융합(late fusion)을 사용한다.
실험 결과
연구 질문
- RQ1저수준 특징의 전역 정렬이 실제 영상 변동성으로 인한 노이즈를 줄이고 중위수 어휘 구성에 기여할 수 있는가?
- RQ2리만 다양체 모델(Grassmann, SPD, 가우시안)은 유클리드 방법에 비해 중위수 특징 표현을 어떻게 향상시키는가?
- RQ3BoVW, VLAD, FV의 리만 확장 방식이 실제 데이터셋에서 행동 인식 정확도를 얼마나 향상시킬 수 있는가?
- RQ4다양한 중위수 어휘 모델링 전략을 융합하면 개별 접근 방식보다 더 높은 성능을 낼 수 있는가?
- RQ5제안된 방법은 기존 중위수 표현 기법보다 낮은 계산 비용으로 최신 기술 수준의 결과를 달성할 수 있는가?
주요 결과
- 제안된 방법은 YouTube 데이터셋에서 90.3%의 정확도를 기록하여 이전 최신 기술 수준 방법을 초월한다.
- UCF50에서의 정확도는 90.7%에 달하며, Action-Gons 및 Actons를 포함한 이전 연구들보다 뛰어나다.
- HMDB51에서의 정확도는 56.4%를 기록하여 이전 중위수 방법인 Action-parts 및 Motionlets보다 뚜렷이 향상되었다.
- ASLAN에서의 행동 유사도 레이블링 작업에서는 65.17%의 정확도와 70.29%의 AUC를 기록하여 모든 이전 비지도 기반 기준선을 능가한다.
- 영상당 평균 계산 시간은 43.9초로, Motionlets(70초), Action-parts(227초), Action Bank(1156초)보다 현저히 빠르게 감소하였다.
- 묘사자와 중위수 어휘 모델의 후기 융합이 모든 데이터셋에서 최고의 성능을 보였으며, 다중 모odal 및 다중 구조 표현의 유용성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.