[논문 리뷰] Fast Object Detection in Compressed Video
이 논문은 압축 동영상에서 빠른 객체 검출을 위한 MMNet을 제안한다. 이는 동영상 코덱에서 유도된 운동 벡터와 잔차 오차를 활용하여 특징 추출을 가속화한다. I-프레임에서 추출한 특징을 P-프레임으로 경량 메모리 네트워크를 통해 전파함으로써 MMNet은 MANet 대비 최대 10배 빠른 추론 속도를 달성했으며, ImageNet VID에서 정확도 손실는 최소한이다.
Object detection in videos has drawn increasing attention since it is more practical in real scenarios. Most of the deep learning methods use CNNs to process each decoded frame in a video stream individually. However, the free of charge yet valuable motion information already embedded in the video compression format is usually overlooked. In this paper, we propose a fast object detection method by taking advantage of this with a novel Motion aided Memory Network (MMNet). The MMNet has two major advantages: 1) It significantly accelerates the procedure of feature extraction for compressed videos. It only need to run a complete recognition network for I-frames, i.e. a few reference frames in a video, and it produces the features for the following P frames (predictive frames) with a light weight memory network, which runs fast; 2) Unlike existing methods that establish an additional network to model motion of frames, we take full advantage of both motion vectors and residual errors that are freely available in video streams. To our best knowledge, the MMNet is the first work that investigates a deep convolutional detector on compressed videos. Our method is evaluated on the large-scale ImageNet VID dataset, and the results show that it is 3x times faster than single image detector R-FCN and 10x times faster than high-performance detector MANet at a minor accuracy loss.
연구 동기 및 목표
- 영상 객체 검출에서 무거운 CNN을 사용해 밀도 높은 영상 프레임을 처리할 때 발생하는 계산 비효율성을 해결한다.
- H.264와 같은 압축 동영상 코덱에 이미 내장된 운동 정보를 활용하여 중복 계산을 방지한다.
- I-프레임에서 추출한 특징을 P-프레임으로 효율적으로 전달하는 경량 메모리 네트워크를 개발한다.
- 메모리 네트워크에 피라미드형 특징 주의 메커니즘을 통합하여 압축된 영상에서 다중 척도 객체 검출을 가능하게 한다.
- 원천적인 코덱 신호를 활용하면 정확도를 희생시키지 않고도 추론 속도를 향상시킬 수 있음을 입증한다.
제안 방법
- 기준 프레임으로 I-프레임을 사용하고, 깊은 특징을 추출하기 위해 오직 I-프레임에서 전체 인식 네트워크를 실행한다.
- 후속 P-프레임에 대해서는 I-프레임 특징과 운동 벡터를 입력으로 받는 경량 메모리 네트워크를 적용한다.
- 영상 스트림에서 유도된 운동 벡터와 잔차 오차를 통합하여 프레임 간 특징의 정렬과 보정을 수행한다.
- 다중 척도 특징 전파를 향상시키기 위해 피라미드형 특징 주의 메커니즘을 구현한다.
- 운동 신호와 잔차 오차를 기반으로 P-프레임의 정확한 특징을 예측하기 위해 메모리 네트워크를 엔드 투 엔드로 훈련한다.
- 제안된 MMNet을 상자 수준 NMS와 같은 후처리 기법과 결합하여 검출 성능을 추가로 향상시킨다.
실험 결과
연구 질문
- RQ1압축된 영상 내 운동 벡터와 잔차 오차는 영상 객체 검출을 가속화하는 데 효과적으로 활용될 수 있는가?
- RQ2코덱 내부 신호를 이용한 특징 전파 방식이 유동 기반 방법과 비교해 속도와 정확도 측면에서 어떻게 성능을 내는가?
- RQ3경량 메모리 네트워크는 정확도를 유지하면서 I-프레임에서 P-프레임으로 특징을 효과적으로 전달할 수 있는가?
- RQ4피라미드형 특징 주의 메커니즘이 압축된 영상에서 다중 척도 객체 검출을 향상시키는가?
- RQ5MMNet은 대규모 영상 검출 벤치마크에서 경쟁적인 mAP 성능을 유지하면서 추론 시간을 얼마나 줄일 수 있는가?
주요 결과
- MMNet은 고성능 영상 검출기인 MANet 대비 최대 10배 빠른 추론 속도를 달성했으며, mAP 손실는 최소한이다.
- 단일 이미지 검출기인 R-FCN 대비 3배 빠른 속도를 기록했으며, ImageNet VID 데이터셋에서 경쟁 가능한 정확도를 유지했다.
- 후처리 기법과 결합했을 때 MMNet은 41 fps에서 73.0%의 mAP를 달성했고, 8 fps에서는 최대 79.2%의 mAP를 기록했다.
- 운동 벡터는 특징 전파에 충분한 운동 신호를 제공하며, 유동 추정 방식보다 빠르고 효율적이다.
- 피라미드형 특징 주의 메커니즘은 다양한 척도 간 공간적 세부 정보를 유지함으로써 효과적인 다중 척도 검출을 가능하게 한다.
- 시각화 결과는 운동 벡터가 정확한 특징 정렬을 이끌어내어 신뢰할 수 있는 바운딩 박스 예측을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.