[논문 리뷰] Training of SSD(Single Shot Detector) for Facial Detection using Nvidia Jetson Nano
이 논문은 MobileNetV2 백본을 사용하는 SSD(Single Shot Detector)를 활용한 경량 얼굴 검출 시스템을 제시한다. 훈련은 PyTorch를 사용해 139장의 이미지 데이터셋으로 수행되었으며, NVIDIA Jetson Nano에 배포되었다. 모델은 훈련 시간이 약 2시간 이내로 약 97%의 정확도를 달성하였으며, TensorRT 최적화를 통해 실시간 성능을 확보한 엣지 디바이스에서 빠르고 정확한 추론을 구현하였다.
In this project, we have used the computer vision algorithm SSD (Single Shot detector) computer vision algorithm and trained this algorithm from the dataset which consists of 139 Pictures. Images were labeled using Intel CVAT (Computer Vision Annotation Tool) We trained this model for facial detection. We have deployed our trained model and software in the Nvidia Jetson Nano Developer kit. Model code is written in Pytorch's deep learning framework. The programming language used is Python.
연구 동기 및 목표
- 에지 배포에 적합한 실시간 얼굴 검출 시스템을 개발하기 위해.
- 139장의 얼굴 이미지로 구성된 소규모 맞춤형 데이터셋에서 경량 SSD 모델을 훈련하기 위해.
- 자원이 제한된 NVIDIA Jetson Nano 플랫폼에서 훈련된 모델을 배포하고 최적화하기 위해.
- PyTorch와 TensorRT를 사용해 SSD 모델의 추론 성능과 정확도를 평가하기 위해.
- 최소한의 데이터와 엣지 하드웨어를 사용해 실세계의 얼굴 검출이 가능한지를 입증하기 위해.
제안 방법
- 139장의 레이블이 부여된 얼굴 이미지로 구성된 맞춤형 데이터셋을 사용해, MobileNetV2 백본을 갖춘 SSD 모델을 PyTorch로 훈련시켰다.
- 이미지 어노테이션에는 Intel CVAT를 사용하였으며, 세 개의 클래스(Saif, Hadi, Rashid)와 기본 배경 클래스를 포함하였다.
- 훈련를 5 에포크 및 에포크당 2 반복으로 설정하였으며, 백본 및 추가 레이어에 대해 기본 학습률 0.01을 사용하였다.
- NVIDIA TensorRT를 사용해 추론 파이프라인을 최적화하여 Jetson Nano에서의 추론 속도를 향상시켰다.
- 훈련된 모델을 Jetson Nano의 Docker 컨테이너에 배포하여 실시간 영상 입력을 위해 A4Tech 웹캠과 연동하였다.
- 객체 검출 및 분류에 단일 전방향 프로세스를 활용하였으며, 다중 척도 객체 예측을 위한 멀티박스 기법을 적용하였다.
실험 결과
연구 질문
- RQ1139장의 소규모 맞춤형 데이터셋으로 SSD에 MobileNetV2를 사용할 경우 효과적인 얼굴 검출이 가능한가?
- RQ2TensorRT 최적화를 통해 Jetson Nano에 배포된 SSD의 정확도 및 추론 속도는 얼마나 우수한가?
- RQ3초기 학습률, 에포크 수 등 하이퍼파라미터 설정이 저데이터 환경에서 모델 수렴 및 성능에 미치는 영향은 어떠한가?
- RQ4Jetson Nano와 같은 엣지 하드웨어에서 최소한의 훈련 시간으로 높은 정확도를 달성할 수 있는가?
- RQ5PyTorch, CVAT, TensorRT의 통합이 임베디드 시스템에서 엔드 투 엔드 얼굴 검출에 얼마나 효과적인가?
주요 결과
- 훈련된 SSD 모델은 테스트 세트에서 약 97%의 정확도를 달성하여 소규모 데이터셋 크기에도 불구하고 뛰어난 성능을 보였다.
- Jetson Nano의 최고 성능을 활용해 약 2시간 내에 훈련이 완료되었다.
- 모델은 성공적으로 배포되어 A4Tech 웹캠을 통해 30fps 영상 입력을 받으며 저지연 추론으로 실시간으로 작동하였다.
- TensorRT의 사용으로 추론 속도가 크게 향상되어 GPU 가속 기반의 Jetson Nano에서 실시간 성능을 확보할 수 있었다.
- 110장의 훈련 이미지와 29장의 검증 이미지로도 SSD 아키텍처에 MobileNetV2 백본을 적용한 것이 얼굴 검출에 효과적임을 입증하였다.
- CVAT를 사용한 어노테이션과 Docker를 활용한 컨테이너 기반 배포로 엣지 AI 배포를 위한 간소화되고 재현 가능한 파이프라인을 확보할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.