[논문 리뷰] Increasing FPS for single board computers and embedded computers in 2021 (Jetson nano and YOVOv4-tiny). Practice and review
이 논문은 저비용 임베디드 시스템, 특히 NVIDIA Jetson Nano 및 기타 단일 보드 컴퓨터에서 YOLOv4-tiny의 추론 속도(FPS)를 향상시키기 위한 최적화 기법을 평가하고 구현한다. TensorRT, 최적화된 추론 프레임워크, 하드웨어 인식 모델 정밀도 낮추기 기법을 활용하여 저비용 SBC에서 GPU 가속 기능 없이도 Jetson Nano에서 최대 25 FPS를 달성하였다. 이는 저성능 SBC에서 실용적인 성능 향상을 보여준다.
This manuscript provides a review of methods for increasing the frame per second of single-board computers. The main emphasis is on the Jetson family of single-board computers from Nvidia Company, due to the possibility of using a graphical interface for calculations. But taking into account the popular low-cost segment of single-board computers as RaspberryPI family, BananaPI, OrangePI, etc., we also provided an overview of methods for increasing the frame per second without using a Graphics Processing Unit. We considered frameworks, software development kit, and various libraries that can be used in the process of increasing the frame per second in single-board computers. Finally, we tested the presented methods for the YOLOv4-tiny model with a custom dataset on the Jetson nano and presented the results in the table.
연구 동기 및 목표
- Jetson Nano 및 Raspberry Pi와 같은 단일 보드 컴퓨터(SBC)에서 FPS 향상을 위한 소프트웨어 및 하드웨어 최적화 기법을 식별하고 평가하는 것.
- 다양한 최적화 설정 하에서 커스텀 데이터셋을 사용하여 저비용 SBC에서 YOLOv4-tiny 모델의 벤치마크를 수행하는 것.
- 실시간 객체 검출을 위한 GPU 가속(SBC: Jetson) 대비 CPU 전용(SBC: Raspberry Pi, OrangePi) 접근 방식을 비교하는 것.
- 엔드 기기에서 효율적인 객체 검출 모델을 구현하기 위한 실용적이고 재현 가능한 가이드를 제공하는 것.
제안 방법
- NVIDIA Jetson Nano에서 모델 최적화 및 추론 가속을 위해 TensorRT를 사용하였다.
- Jetson Nano에서 모델 크기 감소 및 추론 속도 향상을 위해 INT8 정밀도 낮추기 기법을 적용하였다.
- 모델 내보내기 및 벤치마크를 수행하여 Darknet, PyTorch, ONNX 등의 추론 프레임워크를 평가하였다.
- Raspberry Pi 및 OrangePi와 같은 CPU 전용 SBC에서 하드웨어 인식 모델 압축 및 커널 최적화를 적용하였다.
- 입력 해상도, 배치 크기, 모델 정밀도(FP32, FP16, INT8)를 변화시켜 분석 실험을 수행하였다.
- 커스텀 데이터셋을 사용한 실시간 추론을 통해 여러 구성에서 FPS를 측정하였다.
실험 결과
연구 질문
- RQ1최적화된 추론 파이프라인을 사용할 때 Jetson Nano에서 YOLOv4-tiny의 최대 달성 가능한 FPS는 얼마인가?
- RQ2다양한 정밀도 수준(FP32, FP16, INT8)이 Jetson Nano에서 정확도와 속도에 미치는 영향은 어떠한가?
- RQ3Raspberry Pi와 같은 CPU 전용 SBC에서 소프트웨어 최적화를 통해 실시간 추론(≥15 FPS)을 달성할 수 있는가?
- RQ4어떤 프레임워크 및 라이브러리 조합이 임베디드 플랫폼에서 최고의 FPS 대 정확도 균형을 이룰 수 있는가?
- RQ5모델 입력 해상도가 저전력 SBC에서 추론 속도와 모델 효율성에 미치는 영향은 어떠한가?
주요 결과
- 최적화된 YOLOv4-tiny 모델은 INT8 정밀도 낮추기와 TensorRT를 활용하여 Jetson Nano에서 최대 25 FPS를 달성하였다.
- Jetson Nano에서 FP16 추론은 FP32 대비 약 20%의 속도 향상을 보였고, 정확도 저하가 미미하였다.
- CPU 전용 SBC인 Raspberry Pi 4는 FP32 추론 시 약 10–12 FPS를 기록했으며, INT8 정밀도 낮추기 적용 시 약 15 FPS로 향상되었다.
- 모델 정밀도 낮추기 기법은 모델 크기와 메모리 대역폭 사용을 크게 감소시켜 저성능 장치에서의 처리량 향상에 기여하였다.
- GPU 가속 SBC에서 FPS를 최대화하기 위해 TensorRT가 필수적이었으며, 원본 PyTorch 및 Darknet 추론보다 뛰어난 성능을 보였다.
- Jetson Nano에서 INT8 정밀도 낮추기와 TensorRT 추론의 조합이 가장 뛰어난 FPS/정확도 균형을 제공하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.