Skip to main content
QUICK REVIEW

[논문 리뷰] Fast Video Shot Transition Localization with Deep Structured Models

Shitao Tang, Litong Feng|ArXiv.org|2018. 08. 13.
Video Analysis and Summarization참고 문헌 23인용 수 11
한 줄 요약

이 논문은 깊이 학습 모델을 전용으로 사용하여 절단 전환과 점진적 전환을 별도로 검출하는 빠르고 두 단계로 구성된 캐스케이드 프레임워크를 제안한다. 경량 필터링 모듈과 전용 절단 및 점진적 전환 검출기들을 활용함으로써, TRECVID07과 RAI에서 최신 기술 수준의 성능을 달성하면서도 실시간 속도의 30배를 확보하였다. 또한 학습 및 평가를 위한 새로운 대규모 데이터셋인 ClipShots를 제공한다.

ABSTRACT

Detection of video shot transition is a crucial pre-processing step in video analysis. Previous studies are restricted on detecting sudden content changes between frames through similarity measurement and multi-scale operations are widely utilized to deal with transitions of various lengths. However, localization of gradual transitions are still under-explored due to the high visual similarity between adjacent frames. Cut shot transitions are abrupt semantic breaks while gradual shot transitions contain low-level spatial-temporal patterns caused by video effects in addition to the gradual semantic breaks, e.g. dissolve. In order to address the problem, we propose a structured network which is able to detect these two shot transitions using targeted models separately. Considering speed performance trade-offs, we design a smart framework. With one TITAN GPU, the proposed method can achieve a 30\( imes\) real-time speed. Experiments on public TRECVID07 and RAI databases show that our method outperforms the state-of-the-art methods. In order to train a high-performance shot transition detector, we contribute a new database ClipShots, which contains 128636 cut transitions and 38120 gradual transitions from 4039 online videos. ClipShots intentionally collect short videos for more hard cases caused by hand-held camera vibrations, large object motions, and occlusion.

연구 동기 및 목표

  • 영상 스트림에서 돌연한 절단 전환과 점진적 전환(예: 용해)을 정확하게 국소화하는 도전 과제를 해결한다.
  • 이전 방법들이 단일 유사도 함수를 사용함으로써 점진적 전환에 어려움을 겪는 한계를 극복한다. 이는 높은 프레임 유사도로 인해 점진적 전환을 식별하기 어려운 데 기인한다.
  • 초기 필터링과 전문화된 검출기들을 도입함으로써 정확도를 유지하면서도 검출 속도를 향상시키는 캐스케이드 아키텍처를 제안한다.
  • 고성능 딥 러닝 모델을 위한 영상 셸터 경계 검출을 지원하기 위해 다양한 조건을 포함한 대규모이고 다양한 트레이닝 데이터셋을 제공한다.
  • 오염, 운동, 조명 변화와 같은 다양한 영상 조건에서도 견고한 성능을 달성한다.

제안 방법

  • 첫 번째 단계에서 다중 스케일에서 후보 전환 영역를 신속하게 식별하기 위해 적응형 임계값 기반의 경량 필터링 모듈을 적용하여 검색 공간을 최대 50% 감소시킨다.
  • 연속된 프레임 간의 이미지 유사도 함수를 학습하는 2D ConvNet 기반의 절단 전환 검출기를 사용하여 돌연한 의미적 단절을 검출한다.
  • 영상 세그먼트 내의 다중 스케일 시공간 패턴을 캡처하는 새로운 C3D ConvNet 기반의 점진적 전환 검출기를 설계하여 점진적 전환을 국소화한다.
  • 기본 박스에 영감을 받은 단일 스탑 경계 검출(SSBD) 전략을 구현하여 점진적 전환의 국소화 정확도를 향상시킨다.
  • 필터링 단계가 처리 속도를 가속화하고, 두 전문화된 검출기가 높은 정밀도로 예측를 정밀하게 보정하는 캐스케이드 아키텍처를 통합한다.
  • 최근에 도입된 ClipShots 데이터셋을 사용하여 모델을 학습한다. 이 데이터셋은 4,039개의 온라인 영상에서 유래했으며, 128,636개의 절단 전환과 38,120개의 점진적 전환을 포함하고 있으며, 카메라 흔들림과 오염과 같은 도전적인 조건을 수반한다.

실험 결과

연구 질문

  • RQ1전용 검출기를 갖춘 두 단계 캐스케이드 프레임워크가 절단 전환과 점진적 전환을 동시에 검출하는 데 있어 통합 모델보다 우수한 성능을 낼 수 있는가?
  • RQ2경량 필터링 모듈이 두 전환 유형의 재현율을 유지하면서 영상 셸터 경계 검출 속도를 얼마나 빠르게 개선할 수 있는가?
  • RQ3전용 C3D 기반 모델이 다양한 길이와 시각적 패턴에서 점진적 전환을 국소화하는 데 얼마나 효과적인가?
  • RQ4ClipShots와 같은 대규모이고 다양한 영상 조건을 포함한 데이터셋이 딥 러닝 기반의 영상 셸터 경계 검출기의 일반화 능력과 성능을 향상시키는 데 기여하는가?
  • RQ5영상 전환 검출에서 속도와 정확도 사이의 상충 관계는 어떠한가? 정밀도를 희생시키지 않고도 실시간 성능를 달성할 수 있는가?

주요 결과

  • 제안된 방법은 단일 TITAN GPU에서 30배 실시간 추론 속도를 달성하여 이전 방법들(예: deepSBD)을 크게 앞서간다.
  • TRECVID07 데이터셋에서, 원본 레이블을 사용할 경우 절단 전환의 F1 점수를 0.6% 향상시켜 F1 = 0.980를 달성하였고, 점진적 전환의 F1 점수는 2.9% 향상시켜 F1 = 0.810를 기록하였다. 이는 최신 기술 수준의 성능을 초월한 것이다.
  • TRECVID07에서 정정된 진짜값을 사용할 경우 점진적 전환의 F1 점수는 6.4% 향상되어 F1 = 0.841을 달성하였으며, 이는 높은 정확도와 강건성을 입증한다.
  • RAI 데이터셋에서, 후처리 필터링을 사용하지 않아도 deepSBD(0.934)를 능가하는 경쟁력 있는 성능(F1 = 0.935)을 기록하였다.
  • 점진적 전환 검출기는 정밀한 경계 국소화를 유지하며, IOU 임계값 0.75에서 F1 점수 0.618을 기록하였다.
  • 128,636개의 절단 전환과 38,120개의 점진적 전환을 포함한 ClipShots 데이터셋은 영상 셸터 경계 검출을 위한 첫 번째 대규모 공개 기준 데이터셋으로, 향후 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.