Skip to main content
QUICK REVIEW

[논문 리뷰] Real-Time Activity Recognition and Intention Recognition Using a Vision-based Embedded System

Sahar Darafsh, Saeed Shiry Ghidary|arXiv (Cornell University)|2021. 07. 27.
Video Surveillance and Tracking Methods참고 문헌 42인용 수 7
한 줄 요약

이 논문은 단일 AlexNet CNN를 사용하여 속도 및 방향 특징으로 표현된 영상 데이터를 분류함으로써 실시간 비전 기반 임베디드 시스템을 제안하며, 자체 개발한 의도 인식 데이터셋에서 98.78%의 정확도를 달성하고 벤치마크 데이터셋에서는 78.48–100%의 정확도를 기록하며, FPGA 기반 ZCU102 플랫폼에서 120 fps로 실시간 성능을 구현한다.

ABSTRACT

With the rapid increase in digital technologies, most fields of study include recognition of human activity and intention recognition, which are essential in smart environments. In this study, we equipped the activity recognition system with the ability to recognize intentions by affecting the pace of movement of individuals in the representation of images. Using this technology in various environments such as elevators and automatic doors will lead to identifying those who intend to pass the automatic door from those who are passing by. This system, if applied in elevators and automatic doors, will save energy and increase efficiency. For this study, data preparation is applied to combine the spatial and temporal features with the help of digital image processing principles. Nevertheless, unlike previous studies, only one AlexNet neural network is used instead of two-stream convolutional neural networks. Our embedded system was implemented with an accuracy of 98.78% on our intention recognition dataset. We also examined our data representation approach on other datasets, including HMDB-51, KTH, and Weizmann, and obtained accuracy of 78.48%, 97.95%, and 100%, respectively. The image recognition and neural network models were simulated and implemented using Xilinx simulators for the Xilinx ZCU102 board. The operating frequency of this embedded system is 333 MHz, and it works in real-time with 120 frames per second (fps).

연구 동기 및 목표

  • 에스컬레이터 및 자동문과 같은 스마트 환경에서 인간의 의도를 인식하기 위한 저비용, 실시간 임베디드 시스템을 개발하기 위해.
  • 기존의 비전 기반 시스템의 한계, 즉 카메라 각도, 조도, 신체 자세 변화에 대한 민감성 문제를 해결하기 위해.
  • 자동 문 및 엘리베이터가 사용을 의도하는 사람과 지나다니기만 하는 사람을 구분함으로써 에너지 효율성을 향상시키기 위해.
  • RGB 데이터나 이중 스트림 CNN에 의존하지 않고도 운동 속도와 방향을 포착하는 영상 표현 방법을 설계하기 위해.
  • 실시간 및 저전력 배포를 위해 FPGA 플랫폼에서 시스템을 구현하고 검증하기 위해.

제안 방법

  • RGB 데이터가 필요 없고 카메라 각도에 대한 의존도를 줄이는 데 초점을 맞춘 운동 속도 및 방향 특징을 활용한 새로운 영상 표현 방법을 제안한다.
  • 처리된 영상 특징에서 활동과 의도를 분류하기 위해 이중 스트림 CNN 대신 단일 AlexNet 컨volutional 신경망을 사용한다.
  • 영상 시퀀스에서 공간적 및 시간적 특징을 추출하기 위해 디지털 영상 처리 기법을 적용하며, 운동 역학에 중점을 둔다.
  • ZCU102 FPGA 보드에서 실시간 처리를 위해 333 MHz 클럭 주파수에서 Xilinx Vivado 도구를 사용해 시스템을 시뮬레이션하고 합성한다.
  • 저전력 소비와 고처리량을 위해 시스템을 최적화하여 120 fps 처리 능력을 달성한다.
  • 다양한 조건에서의 강건성 평가를 위해 여러 데이터셋(HMDB-51, KTH, Weizmann)을 통해 방법을 검증한다.

실험 결과

연구 질문

  • RQ1RGB 입력 없이 운동 기반 영상 표현을 사용하여 단일 CNN이 인간의 활동과 의도를 효과적으로 인식할 수 있는가?
  • RQ2제안된 운동 특징 표현 방법은 카메라 각도, 조도, 장면 복잡도가 다양한 다양한 데이터셋에서 어떻게 성능을 발휘하는가?
  • RQ3저전력 임베디드 FPGA 하드웨어에서 시스템이 실시간 성능과 높은 정확도를 얼마나 오랫동안 유지할 수 있는가?
  • RQ4시스템은 자동 문이나 엘리베이터를 사용하려는 사람과 지나다니기만 하는 사람을 신뢰성 있게 구분할 수 있는가?
  • RQ5정확도와 효율성 측면에서 기존의 이중 스트림 CNN 또는 수작업 특징 기반 접근법에 비해 시스템의 성능은 어떻게 비교되는가?

주요 결과

  • 자체 개발한 의도 인식 데이터셋에서 시스템은 98.78%의 정확도를 기록하여 의도가 있는 행동과 없는 행동을 높은 효과로 구분함을 입증했다.
  • HMDB-51 데이터셋에서 78.48%의 정확도를 달성하여 조도, 자세, 카메라 각도 변화에도 불구하고 강건성을 보였다.
  • KTH 데이터셋에서 97.95%의 정확도를 기록하여 통제된, 잘 정렬된 인간 행동에 대해 뛰어난 성능을 보였다.
  • Weizmann 데이터셋에서 100%의 정확도를 달성하여 명확하고 잘 정의된 운동을 인식하는 데 효과적임을 입증했다.
  • ZCU102 FPGA 보드에서 120 프레임 매초로 실시간으로 작동하여 표준 USB 카메라의 30 fps 입력 레이트를 초과했다.
  • 온칩 전력 소모는 7.326 W이며 열 여유가 67.8°C로, 저전력 장기 운영에 대한 실현 가능성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.