Skip to main content
QUICK REVIEW

[논문 리뷰] RGait-NET: An Effective Network for Recovering Missing Information from Occluded Gait Cycles

Dhritimaan Das, Ayush Agarwal|arXiv (Cornell University)|2019. 12. 14.
Gait Recognition and Analysis참고 문헌 38인용 수 7
한 줄 요약

이 논문은 VGG-16 백본을 사용해 부정확한 프레임을 탐지하고, 다중 목적의 LSTM 네트워크를 통해 손실된 실루엣을 복원하는 딥러닝 프레임워크인 RGait-NET을 제안한다. 이는 딱도 및 교차 엔트로피 손실을 함께 최적화하여 학습된다. 제안된 방법은 도전적인 TUM-IITKGP 데이터셋에서 94.28%의 Rank-1 인식 정확도를 달성하여, 심각한 가림 상태에서 기존 방법보다 25% 이상 높은 정확도를 확보하였다.

ABSTRACT

Gait of a person refers to his/her walking pattern, and according to medical studies gait of every individual is unique. Over the past decade, several computer vision-based gait recognition approaches have been proposed in which walking information corresponding to a complete gait cycle has been used to construct gait features for person identification. These methods compute gait features with the inherent assumption that a complete gait cycle is always available. However, in most public places occlusion is an inevitable occurrence, and due to this, only a fraction of a gait cycle gets captured by the monitoring camera. Unavailability of complete gait cycle information drastically affects the accuracy of the extracted features, and till date, only a few occlusion handling strategies to gait recognition have been proposed. But none of these performs reliably and robustly in the presence of a single cycle with incomplete information, and because of this practical application of gait recognition is quite limited. In this work, we develop deep learning-based algorithm to accurately identify the affected frames as well as predict the missing frames to reconstruct a complete gait cycle. While occlusion detection has been carried out by employing a VGG-16 model, the model for frame reconstruction is based on Long-Short Term Memory network that has been trained to optimize a multi-objective function based on dice coefficient and cross-entropy loss. The effectiveness of the proposed occlusion reconstruction algorithm is evaluated by computing the accuracy of the popular Gait Energy Feature on the reconstructed sequence. Experimental evaluation on public data sets and comparative analysis with other occlusion handling methods verify the effectiveness of our approach.

연구 동기 및 목표

  • 완전한 걸음 패턴 시퀀스가 거의 확보되지 않는 감시 환경에서 부분적 또는 완전한 가림 상태에서의 가정 인식 문제를 해결한다.
  • 기존 방법들이 부족한 데이터나 특정 가정 패턴 분포를 전제로 하는 한계를 극복한다.
  • 단일 사이클 가정 시퀀스에서 손실된 프레임을 탐지하고 복원하는 강력한 종단 간 딥러닝 파이프라인을 개발한다.
  • 자주 발생하는 가림 상태가 있는 실세계 환경에서의 가정 인식 시스템의 실용적 구현을 가능하게 한다.
  • 외부 사이클 매칭이나 평균화에 의존하지 않고도 높은 품질의 가정 시퀀스를 복원함으로써 인식 정확도를 향상시킨다.

제안 방법

  • 실루엣 품질과 공간 일관성을 기반으로, 사전 학습된 VGG-16 네트워크를 사용해 프레임을 가림 또는 비가림으로 분류한다.
  • 가정을 시간적 시퀀스로 모델링하여, LSTM 네트워크를 사용해 손실된 실루엣을 복원한다.
  • 분할 정확도와 경계 정밀도를 균형 있게 유지하기 위해 딱도 계수와 교차 엔트로피를 조합한 다중 목적 손실 함수로 LSTM를 최적화한다.
  • 맞춤형 파이썬 스크립트를 사용해 CASIA-B 데이터셋에 가림을 합성하여, 탐지 및 복원 작업을 위한 다양한 훈련 데이터를 생성한다.
  • 공개 벤치마크에서 성능 평가를 위해 복원된 시퀀스에서 추출한 가정 에너지 이미지(GEI) 특징을 사용한다.
  • 실세계 정적 및 동적 가림이 포함된 TUM-IITKGP 데이터셋에서 모델를 훈련 및 검증하여, 강인성과 일반화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1딥러닝 기반 접근법이 단일 가정 사이클 시퀀스에서 정적 및 동적 가림을 효과적으로 탐지할 수 있는가?
  • RQ2비가림 프레임만을 입력으로 사용할 때, LSTM 기반 생성 모델이 높은 정밀도로 손실된 가정 프레임을 복원할 수 있는가?
  • RQ3제안된 다중 목적 손실 함수가 표준 교차 엔트로피 또는 딱도 단독 학습 대비 복원 품질을 향상시키는가?
  • RQ4인식 정확도 측면에서 제안된 방법은 최신의 가림 처리 기법들과 비교해 어떻게 성능을 내는가?
  • RQ5모델은 다양한 무작위 가중치 초기화 및 다양한 수준의 가림에 대해 강인한가?

주요 결과

  • RGait-NET는 TUM-IITKGP 데이터셋에서 94.28%의 Rank-1 인식 정확도를 달성하여, 기존 방법보다 25% 이상 높은 성능을 보였다.
  • 모델은 높은 강인성을 보였으며, 네 개의 독립적으로 훈련된 모델 간 표준편차가 오직 3.50%에 불과하여 초기화 방식에 따라 안정적인 성능을 유지함을 확인했다.
  • 모든 순위에서 일관되게 높은 정확도를 유지하였으며, Rank 1에서는 94.28%, Rank 5에서는 97.68%로, 검색 수준 전반에서 강력한 일반화 능력을 보였다.
  • 딱도 계수와 교차 엔트로피를 조합한 다중 목적 손실 함수는 단일 손실 대비 더 나은 복원 품질을 이끌어냈다.
  • 이 방법은 정적 및 동적 가림 모두 효과적으로 처리하였으며, 가우시안 피팅이나 평균화 기반 방법이 실패하는 고가림 수준의 경우에도 잘 작동하였다.
  • 가림 탐지 및 복원을 위한 훈련된 모델, 코드, 데이터는 제공된 링크를 통해 공개되어 재현성과 벤치마크에 기여할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.