Skip to main content
QUICK REVIEW

[논문 리뷰] Real-World Graph Convolution Networks (RW-GCNs) for Action Recognition in Smart Video Surveillance

Justin Sanchez, Christopher Neff|arXiv (Cornell University)|2022. 01. 15.
Human Pose and Action Recognition인용 수 9
한 줄 요약

이 논문은 실세계의 노이즈와 지연 제약 조건을 고려한 엣지 기반 행동 인식에서의 강건성을 향상시키기 위해 주목사용 피드백을 통합한 ST-GCN 아키텍처인 Real-World Graph Convolution Networks (RW-GCNs)를 제안한다. 신경과학과 정보이론에서 영감을 얻은 의미론적 및 제어 피드백 메커니즘을 통합함으로써, NTU-RGB-D-120에서 94.1%의 정확도를 달성하고 ST-GCN 대비 3.02배 빠른 지연 시간을 기록하였으며, 공간적 키포인트 노이즈가 존재하는 Northwestern-UCLA 데이터셋에서도 90.4%의 정확도를 유지하면서 지연 시간을 32.5배 감소시켰다.

ABSTRACT

Action recognition is a key algorithmic part of emerging on-the-edge smart video surveillance and security systems. Skeleton-based action recognition is an attractive approach which, instead of using RGB pixel data, relies on human pose information to classify appropriate actions. However, existing algorithms often assume ideal conditions that are not representative of real-world limitations, such as noisy input, latency requirements, and edge resource constraints. To address the limitations of existing approaches, this paper presents Real-World Graph Convolution Networks (RW-GCNs), an architecture-level solution for meeting the domain constraints of Real World Skeleton-based Action Recognition. Inspired by the presence of feedback connections in the human visual cortex, RW-GCNs leverage attentive feedback augmentation on existing near state-of-the-art (SotA) Spatial-Temporal Graph Convolution Networks (ST-GCNs). The ST-GCNs' design choices are derived from information theory-centric principles to address both the spatial and temporal noise typically encountered in end-to-end real-time and on-the-edge smart video systems. Our results demonstrate RW-GCNs' ability to serve these applications by achieving a new SotA accuracy on the NTU-RGB-D-120 dataset at 94.1%, and achieving 32X less latency than baseline ST-GCN applications while still achieving 90.4% accuracy on the Northwestern UCLA dataset in the presence of spatial keypoint noise. RW-GCNs further show system scalability by running on the 10X cost effective NVIDIA Jetson Nano (as opposed to NVIDIA Xavier NX), while still maintaining a respectful range of throughput (15.6 to 5.5 Actions per Second) on the resource constrained device. The code is available here: https://github.com/TeCSAR-UNCC/RW-GCN.

연구 동기 및 목표

  • 이deal한 자세 데이터와 낮은 지연 시간을 전제로 하는 기존의 스켈레톤 기반 행동 인식 모델들이 실세계 엣지 배포 환경에서는 종종 성립하지 않는 점을 보완하기 위해.
  • 실제로 노이즈가 있는 키포인트 입력과 엣지 시스템에서 흔히 볼 수 있는 엄격한 실시간 지연 제약 조건 하에서도 높은 정확도를 유지할 수 있는 모델을 개발하기 위해.
  • NVIDIA Jetson Nano와 같은 저비용, 자원 제약이 있는 엣지 장치에서 확장 가능하고 프라이버시를 보장하는 배포를 가능하게 하기 위해.
  • 신경과학에서 영감을 얻은 피드백 메커니즘과 정보이론 원리를 융합하여 실세계 스켈레톤 행동 인식의 새로운 하위 분야를 체계화하기 위해.
  • 피드백을 통합한 GCN 아키텍처가 정확도를 희생시키지 않으면서도 노이즈에 대한 강건성과 추론 지연 시간을 동시에 개선할 수 있음을 입증하기 위해.

제안 방법

  • RW-GCNs는 인간 시각 피질의 피드백 순환 구조에서 영감을 얻은 주목사용 피드백 메커니즘을 기존 ST-GCN에 통합한다.
  • 두 가지 유형의 피드백이 도입된다: 의미론적 피드백은 과거 특징을 재처리하여 분류 능력을 향상시키고, 제어 피드백은 시간적 샘플링과 특징 재사용을 관리한다.
  • 아키텍처는 정보 블로킹 이론에서 유도되며, 종단간 시스템에서 공간적 및 시간적 노이즈에 대한 내성을 최적화한다.
  • 피드백 모듈은 경량 설계되어 32개 채널에서만 작동하여 계산 오버헤드를 최소화하고 엣지 장치에서의 효율성을 유지한다.
  • 실제로 존재하는 노이즈, 예를 들어 시간적 Re-ID 오류와 실시간 시스템에서의 완벽하지 않은 자세 추정 오류를 포함한 종단간 평가가 수행된다.
  • 확장성은 NVIDIA Jetson Nano에서 테스트되었으며, 다양한 시나리오 복잡도에서 15.6에서 5.5 Actions per Second (ApS)의 처리량을 기록하였다.

실험 결과

연구 질문

  • RQ1실제 환경에서의 노이즈 조건, 예를 들어 공간적 키포인트 오류와 시간적 불일치 상황에서 주목사용 피드백 메커니즘이 행동 인식 정확도를 향상시킬 수 있는가?
  • RQ2피드백을 통합한 GCN 아키텍처는 표준 ST-GCN 대비 정확도를 유지하거나 향상시키면서 추론 지연 시간을 줄일 수 있는가?
  • RQ3RW-GCNs는 성능을 희생시키지 않고 NVIDIA Jetson Nano와 같은 저비용, 자원 제약이 있는 엣지 장치에서 효율적으로 배포될 수 있는가?
  • RQ4신경과학에서 영감을 얻은 피드백 통합이 완벽하지 않은 입력 데이터를 가진 종단간 엣지 시스템에서 강건성을 향상시키는 데 어떤 영향을 미치는가?
  • RQ5제안된 아키텍처는 실세계 시스템 제약 조건 하에서 NTU-RGB-D-120 및 Northwestern-UCLA와 같은 벤치마크 데이터셋에서 최신 기술 성능을 달성할 수 있는가?

주요 결과

  • RW-GCNs는 NTU-RGB-D-120 데이터셋에서 기존 ST-GCN 기반 모델을 초월하는 새로운 최신 기술 정확도 94.1%를 달성하였다.
  • NTU-RGB-D-120에서 ST-GCN 기반 모델 대비 지연 시간을 3.02배 감소시켰으며, 정확도를 3.8% 포기하면서도 지연 시간을 10배 감소시켰다.
  • Northwestern-UCLA 데이터셋에서 RW-GCNs는 공간적 키포인트 노이즈가 존재하는 상황에서도 90.4%의 정확도를 유지하면서 기준 ST-GCN 대비 지연 시간을 32.5배 감소시켰다.
  • Northwestern-UCLA 데이터셋에서 전체 종단간 시스템 노이즈(시간적 Re-ID 오류 포함) 하에서도 RW-GCNs는 71.8%의 정확도를 기록하였고, 지연 시간을 32.5배 감소시켰다.
  • NVIDIA Jetson Nano에서 효율적으로 실행되어 15.6에서 5.5 Actions per Second (ApS)의 처리량을 기록하였으며, 노드당 비용을 10배 감소시키면서도 유의미한 처리량을 유지함을 입증하였다.
  • 의미론적 피드백 메커니즘은 최소한의 오버헤드만을 유발하여 ApS는 1.6배 증가하고, 파라미터 수도 무시할 수준으로 증가하여 효율성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.