Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervised Video Retrieval Transformer Network

Xiangteng He, Yulin Pan|arXiv (Cornell University)|2021. 04. 16.
Advanced Image and Video Retrieval Techniques참고 문헌 32인용 수 4
한 줄 요약

이 논문은 자기지도 학습 기반의 세트 인코더를 사용해 클립 수준의 비디오 표현을 학습함으로써 비용이 많이 드는 수동 주석 처리를 피하고 저장 및 검색 비용을 줄이는 SVRTN이라는 자기지도 학습 비디오 검색 프레임워크를 제안한다. 이는 FIVR-200K 및 SVD에서 최신 기술 수준의 성능을 달성하며, 비디오 수준 방법 대비 mAP를 최대 30.6% 향상시키고, 프레임 수준 방법 대비 특징 저장 비용을 78.7% 감소시키며 검색 속도를 25배 향상시킨다.

ABSTRACT

Content-based video retrieval aims to find videos from a large video database that are similar to or even near-duplicate of a given query video. Video representation and similarity search algorithms are crucial to any video retrieval system. To derive effective video representation, most video retrieval systems require a large amount of manually annotated data for training, making it costly inefficient. In addition, most retrieval systems are based on frame-level features for video similarity searching, making it expensive both storage wise and search wise. We propose a novel video retrieval system, termed SVRTN, that effectively addresses the above shortcomings. It first applies self-supervised training to effectively learn video representation from unlabeled data to avoid the expensive cost of manual annotation. Then, it exploits transformer structure to aggregate frame-level features into clip-level to reduce both storage space and search complexity. It can learn the complementary and discriminative information from the interactions among clip frames, as well as acquire the frame permutation and missing invariant ability to support more flexible retrieval manners. Comprehensive experiments on two challenging video retrieval datasets, namely FIVR-200K and SVD, verify the effectiveness of our proposed SVRTN method, which achieves the best performance of video retrieval on accuracy and efficiency.

연구 동기 및 목표

  • 비디오 검색에서 높은 비용이 드는 수동 주석 처리에 대한 의존도를 줄이기 위해, 레이블이 없는 비디오를 대상으로 자기지도 학습을 활용한다.
  • 프레임 수준 특징을 압축된 클립 수준 표현으로 집계함으로써 비디오 검색에서의 저장 및 계산 비용을 최소화한다.
  • 세트 트랜스포머 내에서 마스킹된 프레임 모델링을 통해 프레임 순서 변경 및 누락 프레임에 대한 불변성을 확보함으로써 검색의 강건성과 유연성을 향상시킨다.
  • 더 큰 응용 적합성을 위해 클립-클립 및 프레임-클립 검색을 포함한 다양한 검색 모드를 지원한다.

제안 방법

  • 시간적, 공간적, 광학적 변형을 통해 비디오와 그 증강된 버전으로부터 양성 쌍을 생성함으로써 자기지도 학습 기반의 비디오 표현 학습을 수행한다.
  • 다중 헤드 자기주의를 사용해 프레임 간의 상호의존성을 모델링함으로써, 클립 수준의 세트 트랜스포머 네트워크가 프레임 수준 특징을 하나의 클립 수준 표현으로 집계한다.
  • 클립 수준 인코딩에 마스킹된 프레임 모델링을 통합하여 모델이 프레임 순서 변경 및 누락 프레임에 대해 불변성을 확보함으로써 강건성을 향상시킨다.
  • 대규모 검색에서 효율적인 유사도 검색을 위해 비디오 표현을 해싱을 통해 이진화한다.
  • 자기 생성된 양성 쌍을 기반으로 대비 학습을 사용해 특징의 분류 능력을 극대화함으로써, 모델을 엔드 투 엔드로 훈련시킨다.
  • 클립과 개별 프레임을 모두 인코딩함으로써 유연한 검색을 지원하며, 다양한 쿼리 유형을 가능하게 한다.

실험 결과

연구 질문

  • RQ1자기지도 학습이 비디오 표현 학습을 위한 수동 주석 처리를 효과적으로 대체할 수 있는가?
  • RQ2클립 수준 표현 학습이 검색 정확도를 훼손하지 않으면서 저장 및 검색 복잡도를 크게 줄일 수 있는가?
  • RQ3마스킹된 프레임 모델링을 통한 세트 트랜스포머의 사용이 비디오 검색에서 프레임 순서 및 누락 프레임에 대한 강건성을 향상시키는가?
  • RQ4제안된 방법이 클립-클립 및 프레임-클립 검색과 같은 다양한 검색 모드를 지원할 수 있는가?

주요 결과

  • SVRTN은 FIVR-200K 데이터셋의 DSVR 작업에서 비디오 수준 방법 대비 mAP를 30.6% 향상시켰다.
  • FIVR-200K의 CSVR 및 ISVR 작업에서 SVRTN은 각각 비디오 수준 기반 방법 대비 mAP를 28.2%와 21.3% 향상시켰다.
  • SVD 데이터셋에서 SVRTN은 기존 방법 대비 4.7%의 mAP 향상을 달성했다.
  • 프레임 수준 검색 방법 대비 특징 저장 비용을 약 78.7% 감소시켰다.
  • 클립 수준 표현 덕분에 프레임 수준 접근 방식 대비 약 25배 빠른 검색 속도를 확보했다.
  • 모델은 프레임 누락 및 순서 변경에 대해 강력한 강건성을 보이며, 다양한 클립 길이(4초, 6초, 8초)에서도 성능 안정성이 높았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.