[논문 리뷰] DEEPEYE: A Compact and Accurate Video Comprehension at Terminal Devices Compressed with Quantization and Tensorization
DEEPEYE는 실시간 객체 검출을 위한 8비트 양자화된 YOLO와 동작 인식을 위한 텐서라이제이션된 RNN을 통합하여 종단 장치에서 작동하는 컴팩트하고 정확한 영상 이해 시스템을 제안한다. 이 프레임워크는 UCF11에서 16.58%의 정확도 향상과 함께 15,047×의 파라미터 감소 및 2.87×의 속도 향상을 달성하였으며, MOMENTS에서 전정밀도 YOLO와 mAP 차이가 0.47% 이내를 유지한다.
As it requires a huge number of parameters when exposed to high dimensional inputs in video detection and classification, there is a grand challenge to develop a compact yet accurate video comprehension at terminal devices. Current works focus on optimizations of video detection and classification in a separated fashion. In this paper, we introduce a video comprehension (object detection and action recognition) system for terminal devices, namely DEEPEYE. Based on You Only Look Once (YOLO), we have developed an 8-bit quantization method when training YOLO; and also developed a tensorized-compression method of Recurrent Neural Network (RNN) composed of features extracted from YOLO. The developed quantization and tensorization can significantly compress the original network model yet with maintained accuracy. Using the challenging video datasets: MOMENTS and UCF11 as benchmarks, the results show that the proposed DEEPEYE achieves 3.994x model compression rate with only 0.47% mAP decreased; and 15,047x parameter reduction and 2.87x speed-up with 16.58% accuracy improvement.
연구 동기 및 목표
- 자원이 제한된 종단 장치에 대규모 영상 이해 모델을 구현하는 데 도전하는 것.
- 기존 방법들이 객체 검출과 동작 인식을 별도로 최적화하는 데서 비롯되는 한계를 극복하는 것.
- 모델 크기와 추론 시간을 크게 줄이면서도 높은 정확도를 유지하는 통합 프레임워크를 개발하는 것.
- 정확도 손실 없이 YOLO 및 RNN 구성 요소를 압축하기 위해 양자화 및 텐서라이제이션 기법을 통합하는 것.
- 검출 및 인식 파이프라인의 종단 간 최적화를 통해 엣지 장치에서 실시간 영상 분석을 가능하게 하는 것.
제안 방법
- YOLO에 8비트 후기 훈련 양자화를 적용하여 모델 정확도를 유지하면서 모델 크기와 계산 비용을 감소시키는 것.
- YOLO 출력에서 추출한 특징을 바탕으로 영상 분류를 위한 시퀀스 모델링을 위해 텐서라이제이션된 RNN(T-RNN)에 입력하는 것.
- 고차원 텐서를 저랭크 성분으로 분해함으로써 RNN의 가중치 행렬을 압축하기 위해 터커 분해를 사용하는 것.
- 양자화된 YOLO의 특징을 사용하여 T-RNN을 종단 간 훈련함으로써 검출 및 인식의 공동 최적화를 가능하게 하는 것.
- YOLO에 대해선 양자화, RNN에 대해선 텐서라이제이션을 적용하는 하이브리드 접근 방식으로 파라미터 수를 감소시키고 추론 속도를 향상시키는 것.
- 양자화된 YOLO와 텐서라이제이션된 RNN을 하나의 파이프라인으로 통합하여 공동 영상 이해를 수행함으로써 지연 시간과 메모리 사용량을 최소화하는 것.
실험 결과
연구 질문
- RQ18비트 양자화된 YOLO는 종단 장치에 배포 가능하면서도 높은 검출 정확도를 유지할 수 있는가?
- RQ2YOLO에서 추출한 특징을 사용하여 텐서라이제이션된 RNN이 영상 시퀀스를 효과적으로 모델링하면서도 모델 복잡도를 줄일 수 있는가?
- RQ3양자화된 YOLO와 텐서라이제이션된 RNN을 조합함으로써 모델 압축 및 추론 속도 향상에 상당한 기여를 할 수 있는가?
- RQ4통합 시스템은 엣지 장치에서 실시간 영상 이해를 위해 높은 정확도와 낮은 지연 시간을 동시에 달성할 수 있는가?
- RQ5기본 모델 대비 표준 영상 벤치마크에서 파라미터 수, 속도, 정확도 측면에서 제안된 프레임워크는 어떻게 비교되는가?
주요 결과
- MOMENTS 데이터셋에서 DEEPEYE는 mAP가 0.47% 감소하는 데서도 3.994×의 모델 압축률을 달성한다.
- UCF11 데이터셋에서 DEEPEYE는 단순 RNN 기준으로 파라미터를 15,047× 감소시키고 정확도를 16.58% 향상시킨다.
- 전정밀도 YOLO 기준으로 DEEPEYE는 훈련 추론 시간에서 2.87×의 속도 향상을 기록한다.
- 8비트 양자화된 YOLO(Q-YOLO)는 VOC에서 전정밀도 YOLO의 0.5397에 비해 단지 0.47% 낮은 mAP 0.5350을 유지한다.
- Q-YOLO의 특징 입력을 사용하는 텐서라이제이션된 RNN은 UCF11에서 86.09%의 정확도를 달성하여 단순 RNN(69.51%)과 프레임 입력 기반 T-RNN(79.98%)를 모두 뛰어넘는다.
- 제안된 프레임워크는 입력-히든 매핑의 파라미터 수를 58.98M에서 단지 3,920으로 줄여 15,047×의 압축을 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.