[논문 리뷰] Learning Effective Representations from Global and Local Features for Cross-View Gait Recognition
이 논문은 전역적 외관 특징과 국소적 영역 특징을 전문화된 합성곱 레이어를 통해 융합함으로써 걸음걸이 인식 성능을 햖थन하기 위해 국소적 시간 집합(Local Temporal Aggregation, LTA)을 갖춘 전역 및 국소 특징 추출기(Global and Local Feature Extractor, GLFE)를 제안한다. 이 방법은 특징의 구분 능력을 향상시키고 CASIA-B 및 OUMVLP 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.
Gait recognition is one of the most important biometric technologies and has been applied in many fields. Recent gait recognition frameworks represent each human gait frame by descriptors extracted from either global appearances or local regions of humans. However, the representations based on global information often neglect the details of the gait frame, while local region based descriptors cannot capture the relations among neighboring regions, thus reducing their discriminativeness. In this paper, we propose a novel feature extraction and fusion framework to achieve discriminative feature representations for gait recognition. Towards this goal, we take advantage of both global visual information and local region details and develop a Global and Local Feature Extractor (GLFE). Specifically, our GLFE module is composed of our newly designed multiple global and local convolutional layers (GLConv) to ensemble global and local features in a principle manner. Furthermore, we present a novel operation, namely Local Temporal Aggregation (LTA), to further preserve the spatial information by reducing the temporal resolution to obtain higher spatial resolution. With the help of our GLFE and LTA, our method significantly improves the discriminativeness of our visual features, thus improving the gait recognition performance. Extensive experiments demonstrate that our proposed method outperforms state-of-the-art gait recognition methods on popular widely-used CASIA-B and OUMVLP datasets.
연구 동기 및 목표
- 기존의 걸음걸이 인식 방법이 전역적 특징만 고려하거나 국소 영역 간의 공간적 관계를 간과하는 한계를 해결하기 위해.
- 전역적 시각적 맥락과 세밀한 국소 영역 세부 정보를 효과적으로 통합하여 향상된 특징 표현을 위한 통합 프레임워크를 개발하기 위해.
- 새로운 연산을 통해 시간 해상도를 감소시켜 공간 해상도를 증가시킴으로써 시간 시퀀스 동안 공간 정보를 유지하기 위해.
- 교차 시점 환경에서 더 높은 인식 정확도를 달성하기 위해 걸음걸이 특징의 구분 능력을 향상시키기 위해.
제안 방법
- 전역 및 국소 특징을 체계적으로 추출하고 융합하기 위해 새로 설계된 다중 전역 및 국소 합성곱 레이어(GLConv)를 사용하는 전역 및 국소 특징 추출기(GLFE) 모듈을 제안한다.
- 시간 해상도를 감소시켜 공간 해상도를 증가시키는 새로운 연산인 국소적 시간 집합(Local Temporal Aggregation, LTA)을 도입한다. 이는 프레임 간의 공간적 구조를 유지하는 데 기여한다.
- GLConv 레이어를 사용하여 전역 외관 기술자와 국소 영역 기술자를 융합하는 다중 척도 특징 융합 전략을 적용하여 특징의 구분 능력을 향상시킨다.
- 전역 특징이 전반적인 걸음걸이 자세를 캡처하고 국소 특징이 사지 및 신체 부위의 운동 세부 정보를 인코딩하도록 계층적 특징 학습 접근법을 활용한다.
- 채널 수준에서 특징 융합을 적용하여 공간 일관성을 유지하고 후속 인식 작업을 위한 표현 품질을 향상시킨다.
- 표준 분류 손실을 사용하여 엔드 투 엔드 네트워크를 훈련시켜 교차 시점 걸음걸이 인식을 위한 구분 능력 있는 특징 학습을 최적화한다.
실험 결과
연구 질문
- RQ1전역적 외관 특징와 국소적 영역 특징을 융합함으로써 교차 시점 인식에서 걸음걸이 표현의 구분 능력을 향상시킬 수 있는가?
- RQ2걸음걸이 인식에서 시간 시퀀스 모델링 동안 국소 영역 간의 공간적 관계를 어떻게 유지할 수 있는가?
- RQ3시간 해상도를 감소시켜 공간 해상도를 증가시키는 것이 특징 품질과 인식 정확도를 향상시키는가?
- RQ4제안된 GLFE 및 LTA 프레임워크가 벤치마크 걸음걸이 데이터셋에서 기존 최신 기술 수준(SOTA) 방법을 어느 정도 초월하는가?
주요 결과
- 제안된 방법은 CASIA-B 걸음걸이 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 이는 기존 방법들에 비해 교차 시점 걸음걸이 인식에서 뚜렷한 승리를 거두었다.
- OUMVLP 데이터셋에서 제안된 방법은 기존 최신 기술 수준(SOTA) 접근법보다 뛰어난 인식 정확도를 보였으며, 이는 일반화 능력을 확인시켰다.
- GLFE를 통한 전역 및 국소 특징의 융합은 더 구분 능력 있는 표현을 이끌어내어 내부 클래스 변동성을 감소시키고 클래스 간 분리성을 향상시켰다.
- 국소적 시간 집합(LTA) 연산은 공간 해상도를 효과적으로 향상시키고 구조적 세부 정보를 유지하여 특징 품질 향상에 기여하였다.
- 제거 실험 결과, 전역 및 국소 특징 구성 요소가 모두 필수적임을 확인하였으며, 이들의 조합이 가장 높은 성능 향상을 이끌었다.
- 다양한 카메라 시점과 조명 조건에서도 제안된 방법은 강건성을 보였으며, 이는 실제 환경에서의 강력한 일반화 능력을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.