[논문 리뷰] Robust 3D Action Recognition through Sampling Local Appearances and Global Distributions
이 논문은 운동 기반 및 형태 기반 시공간 관심점(STIP)을 사용하여 운동과 형태 특징을 함께 모델링함으로써 3D 동작 인식을 향상시키는 이중층 Bag-of-Visual-Words 모델을 제안한다. 국소 운동 외관을 위한 다중 척도 3D 국소 조향 커널(M3DLSK)과 전반적 형태 분포를 위한 시공간 벡터(STV) 기술자를 도입하여 MSRAction3D에서 91.00%의 정확도를 달성하고, 노이즈, 가림, 동일 클래스 유사성에 대한 강건성을 초과하는 최신 기법들을 능가한다.
3D action recognition has broad applications in human-computer interaction and intelligent surveillance. However, recognizing similar actions remains challenging since previous literature fails to capture motion and shape cues effectively from noisy depth data. In this paper, we propose a novel two-layer Bag-of-Visual-Words (BoVW) model, which suppresses the noise disturbances and jointly encodes both motion and shape cues. First, background clutter is removed by a background modeling method that is designed for depth data. Then, motion and shape cues are jointly used to generate robust and distinctive spatial-temporal interest points (STIPs): motion-based STIPs and shape-based STIPs. In the first layer of our model, a multi-scale 3D local steering kernel (M3DLSK) descriptor is proposed to describe local appearances of cuboids around motion-based STIPs. In the second layer, a spatial-temporal vector (STV) descriptor is proposed to describe the spatial-temporal distributions of shape-based STIPs. Using the Bag-of-Visual-Words (BoVW) model, motion and shape cues are combined to form a fused action representation. Our model performs favorably compared with common STIP detection and description methods. Thorough experiments verify that our model is effective in distinguishing similar actions and robust to background clutter, partial occlusions and pepper noise.
연구 동기 및 목표
- 노이즈, 가림, 배경 혼잡성으로 인해 유사한 동작를 인식하는 데 어려움이 존재하는 문제를 해결하기 위해.
- 기존 방법에서 자주 간과되는 운동 및 형태 특징을 함께 인코딩하여 3D 동작 인식을 향상시키기 위해.
- 시점 변화, 부분적 가림, 심도 불연속성에 강건한 프레임워크를 개발하기 위해.
- 국소 외관과 STIP의 전반적 분포를 융합하는 이중층 BoVW 모델을 설계하여 향상된 동작 표현을 만들기 위해.
- 내부 클래스 이질성과 외부 클래스 유사성을 포함한 다양한 동작 유형과 실제 세계의 변형이 존재하는 벤치마크 데이터셋에서 방법을 검증하기 위해.
제안 방법
- 깊이 데이터의 혼잡성을 억제하고자 새로운 배경 모델링 방법을 제안하여 STIP 검출을 위한 전경 추출을 향상시킨다.
- 운동 신호를 사용하여 운동 기반 STIP을 검출하고, 깊이 맵의 특징적인 공간 구조에서 형태 기반 STIP을 추출한다.
- 운동 기반 STIP 주변의 국소 운동 외관을 쿠보이드 특징을 사용하여 캡처하기 위해 다중 척도 3D 국소 조향 커널(M3DLSK) 기술자를 도입한다.
- 형태 기반 STIP의 전반적 시공간 분포를 인코딩하기 위해 시공간 벡터(STV) 기술자를 제안한다.
- 이중층 Bag-of-Visual-Words(BoVW) 모델이 M3DLSK 및 STV 표현을 융합하여 통합된 동작 표현을 형성한다.
- STIP 검출, 기술자 계산, BoVW 기반 집합을 통합하여 3D 동작 인식을 위한 강건한 파ip라인을 설계한다.
실험 결과
연구 질문
- RQ1국소 운동 외관과 전반적 형태 분포를 융합하는 이중층 BoVW 모델이 3D 동작 인식의 강건성을 향상시키는가?
- RQ2기존 기술자들과 비교해 M3DLSK 기술자가 노이즈가 많은 깊이 데이터에서 국소 운동 구조를 얼마나 효과적으로 캡처하는가?
- RQ3형태 기반 STIP의 시공간 분포를 인코딩함으로써 STV 기술자가 얼마나 동작 인식 성능을 향상시키는가?
- RQ4제안된 배경 모델링 방법이 혼잡한 깊이 영상에서 STIP 검출을 얼마나 향상시키는가?
- RQ5운동 및 형태 특징을 융합함으로써 'highWave'와 'circle'와 같은 유사한 동작 간 혼동을 줄일 수 있는가?
주요 결과
- 제안된 방법은 MSRAction3D 데이터셋에서 91.00%의 정확도를 달성하여 HON4D(80.00%) 및 DSTIP+DCSF(83.60%)를 초월한다.
- SmartHome 데이터셋에서 85.31%의 정확도를 기록하여 내부 클래스 이질성과 외부 클래스 유사성에 대한 강건성을 입증한다.
- 'highWave'와 'circle'와 같은 유사한 동작 간 혼동을 효과적으로 줄이기 위해 운동 및 형태 특징을 함께 모델링함으로써 성능 향상을 달성한다.
- 배경 모델링 방법은 평균 필터 및 ViBe보다 정확도와 계산 효율성 측면에서 뛰어나며, 프레임당 31.25 ms의 시간 소요를 보인다.
- 일부 최신 기법보다는 높은 계산 비용(74.64 ms/frame)을 유발하지만, 상당히 높은 정확도를 달성한다.
- 수정된 MSRAction3D 및 UTKinect-Action 데이터셋에서 부분적 가림, 시점 변화, 심도 노이즈에 대해 강력한 강건성을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.