Skip to main content
QUICK REVIEW

[논문 리뷰] Object Detection in Videos by High Quality Object Linking

Peng Tang, Chunyu Wang|arXiv (Cornell University)|2018. 01. 30.
Advanced Neural Network Applications참고 문헌 42인용 수 7
한 줄 요약

이 논문은 같은 프레임 내 객체를 연결하는 큐브이드 프포절 네트워크, 짧은 튜브릿 검출, 상하좌우 튜브릿 연결을 통해 객체 검출 정확도를 향상시키는 새로운 비디오 객체 검출 프레임워크를 제안한다. 같은 프레임 내 연결을 통해 시간적 일관성을 확보함으로써, ImageNet VID에서 빠르게 움직이는 객체에 대해 정적 이미지 검출기 대비 8.8%의 절대 mAP 향상을 달성한다.

ABSTRACT

Compared with object detection in static images, object detection in videos is more challenging due to degraded image qualities. An effective way to address this problem is to exploit temporal contexts by linking the same object across video to form tubelets and aggregating classification scores in the tubelets. In this paper, we focus on obtaining high quality object linking results for better classification. Unlike previous methods that link objects by checking boxes between neighboring frames, we propose to link in the same frame. To achieve this goal, we extend prior methods in following aspects: (1) a cuboid proposal network that extracts spatio-temporal candidate cuboids which bound the movement of objects; (2) a short tubelet detection network that detects short tubelets in short video segments; (3) a short tubelet linking algorithm that links temporally-overlapping short tubelets to form long tubelets. Experiments on the ImageNet VID dataset show that our method outperforms both the static image detector and the previous state of the art. In particular, our method improves results by 8.8% over the static image detector for fast moving objects.

연구 동기 및 목표

  • 운동 흐림과 초점 왜곡으로 인한 영상 품질 저하 문제를 해결하기 위해.
  • 고품질 객체 연결을 통해 시간적 맥락을 활용하여 검출 정확도를 향상시키기 위해.
  • 특히 빠르게 움직이는 객체에 대해 이웃 프레임 간 연결의 한계를 극복하기 위해.
  • 같은 프레임 내 공간적 겹침에 초점을 맞춰 강력한 객체 연결을 가능하게 하기 위해.
  • ImageNet VID 데이터셋에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 객체의 프레임 간 운동을 둘러싸는 스파티오-타임리얼 후보 큐브이드를 생성하는 큐브이드 프포절 네트워크(CPN)를 도입한다.
  • 프레임 단위의 R-CNN 스타일 검출을 사용하여 짧은 영상 세그먼트에서 객체 인스턴스를 검출하는 짧은 튜브릿 검출 네트워크를 적용한다.
  • 비최대 억제(NMS)를 튜브릿 간 확장하기 위해 튜브릿 겹침 측정을 적용한다.
  • 같은 프레임 내 공간적 겹침을 기반으로 시간적으로 겹치는 튜브릿을 병합하는 짧은 튜브릿 연결 알고리즘을 사용한다.
  • 연결된 튜브릿들 간의 분류 점수를 집계하여 검출 신뢰도를 향상시킨다.
  • 오버랩되는 짧은 세그먼트로 영상을 처리하여 장거리 시간적 맥락 모델링을 가능하게 한다.

실험 결과

연구 질문

  • RQ1이웃 프레임 간 연결과 비교해, 같은 프레임 내 객체 연결이 검출 품질 향상에 기여하는가?
  • RQ2큐브이드 프포절이 영상 내 객체 연결 품질을 어떻게 향상시키는가?
  • RQ3짧은 튜브릿 검출 및 연결을 통해 빠르게 움직이는 객체에 대한 mAP 향상은 어느 정도 이루어지는가?
  • RQ4연결된 튜브릿들 간 점수 집계가 저품질 프레임에서의 거짓 음성 감소에 기여하는가?
  • RQ5정적 이미지 검출기 및 이전 비디오 검출 방법과 비교해, 제안된 방법은 mAP 및 운동 흐림에 대한 강건성 측면에서 어떻게 성능을 내는가?

주요 결과

  • 제안된 방법은 ImageNet VID 데이터셋에서 평균 평균 정밀도(mAP) 74.5%를 달성하여, 정적 이미지 검출기 및 이전 최신 기술 수준의 방법들을 모두 능가한다.
  • 빠르게 움직이는 객체에 대해 정적 이미지 검출기 대비 mAP를 8.8% 향상시켜 운동 흐림에 대한 강건성을 입증한다.
  • 큐브이드 프포절 네트워크를 통해 같은 프레임 내 연결이 가능해져, 이웃 프레임 간 연결 대비 국소화 정확도가 크게 향상된다.
  • 짧은 튜브릿 연결 구성 요소는 오버랩되는 영상 세그먼트를 통해 장거리 시간적 맥락을 활용함으로써 검출 성능을 향상시킨다.
  • 2프레임 세그먼트 기준으로 프레임당 0.35초의 처리 시간를 기록하여 정적 검출기와 유사한 속도를 확보하며, 공유 특징 계산 덕분에 더 긴 세그먼트에서는 추가로 빠른 처리가 가능하다.
  • 시각화 결과는 제안된 방법이 국소화 오류를 감소시키고, 특히 도전적인 프레임에서 튜브릿의 연속성을 향상시킨다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.