Skip to main content
QUICK REVIEW

[논문 리뷰] Dual Encoding for Zero-Example Video Retrieval

Jianfeng Dong, Xirong Li|arXiv (Cornell University)|2018. 09. 17.
Multimodal Machine Learning Applications참고 문헌 36인용 수 7
한 줄 요약

이 논문은 공통 아키텍처를 사용하여 비디오와 자연어 쿼리에 대해 독립적으로 깊이 있는 다중 수준 표현을 학습하는 개념 기반 이중 인코딩 프레임워크를 제안한다. 이는 엔드 투 엔드로 교차 모달 매칭을 가능하게 한다. 계층적 수준에서 평균 풀링, 양방향 GRU, 1D-CNN를 스킵 연결과 함께 조합함으로써, MSR-VTT, TRECVID 2016/2017, MSVD에서 최신 기술을 초월하는 성능을 달성한다. 이는 기존의 개념 기반 및 단일 인코딩 접근 방식보다 제로 예제 비디오 검색에서 뛰어난 성능을 보인다.

ABSTRACT

This paper attacks the challenging problem of zero-example video retrieval. In such a retrieval paradigm, an end user searches for unlabeled videos by ad-hoc queries described in natural language text with no visual example provided. Given videos as sequences of frames and queries as sequences of words, an effective sequence-to-sequence cross-modal matching is required. The majority of existing methods are concept based, extracting relevant concepts from queries and videos and accordingly establishing associations between the two modalities. In contrast, this paper takes a concept-free approach, proposing a dual deep encoding network that encodes videos and queries into powerful dense representations of their own. Dual encoding is conceptually simple, practically effective and end-to-end. As experiments on three benchmarks, i.e. MSR-VTT, TRECVID 2016 and 2017 Ad-hoc Video Search show, the proposed solution establishes a new state-of-the-art for zero-example video retrieval.

연구 동기 및 목표

  • 사용자가 레이블이 없는 비디오를 시각적 예시 없이 자연어 쿼리를 사용해 검색하는 제로 예제 비디오 검색의 과제를 해결하기 위해.
  • 사전 정의된 검출 가능한 개념에 의존하고 개념 선택 및 분류기 훈련 문제로 인해 약점이 있는 개념 기반 방법의 한계를 극복하기 위해.
  • 원시 비디오 프레임과 텍스트 시퀀스에서 직접 강력한 공통 의미 표현을 학습하는 개념 기반, 엔드 투 엔드 프레임워크를 개발하기 위해.
  • 스킵 연결을 통한 다중 수준 인코딩을 통해 계층적이고 상보적인 특징을 학습하여 교차 모달 매칭을 향상시키기 위해.
  • MSR-VTT, TRECVID Ad-hoc Video Search, MSVD를 포함한 다양한 벤치마크에서 이중 인코딩의 효과성을 입증하기 위해.

제안 방법

  • 이 방법은 동일한 다중 수준 인코딩 블록을 사용하여 비디오와 쿼리를 동시에 처리하는 이중 딥 인코딩 네트워크를 활용한다.
  • 각 입력은 세 개의 병렬 스트림을 통해 인코딩된다: 프레임 특징의 평균 풀링, 양방향 GRU(biGRU), 그리고 biGRU 이후 1D 컨볼루션 네트워크를 거친 biGRU-CNN.
  • 스킵 연결을 사용하여 서로 다른 수준의 특징을 결합함으로써, 고수준 표현이 점진적으로 저수준 세부 정보를 통합할 수 있도록 한다.
  • 각 수준에서 세 인코딩 스트림의 출력을 연결하여 최종 표현을 형성함으로써, 각 모odal에 대해 풍부한 계층적 특징 벡터를 생성한다.
  • 이 모달 특화 표현은 유사도 계산을 위해 VSE++를 사용하여 공유 임베딩 공간으로 투영된다.
  • 전체 모델은 엔드 투 엔드로 훈련되며, 비디오의 오프라인 인코딩과 애드혹 쿼리에 대한 실시간 응답을 가능하게 한다.

실험 결과

연구 질문

  • RQ1개념 기반, 엔드 투 엔드 딥 인코딩 프레임워크가 제로 예제 비디오 검색에서 개념 기반 방법을 능가할 수 있는가?
  • RQ2스킵 연결을 통한 다중 수준 인코딩은 비디오와 텍스트에서 전역적, 국소적, 시간적 패턴을 얼마나 효과적으로 포착하는가?
  • RQ3제안된 이중 인코딩은 MSR-VTT, TRECVID 2016/2017, MSVD와 같은 다양한 벤치마크에서 성능 향상에 기여하는가?
  • RQ4이중 프레임워크에서 비디오 측 인코딩이 텍스트 측 인코딩에 비해 얼마나 기여하는가?
  • RQ5제안된 인코딩 모듈은 VSE++와 같은 기존의 공통 공간 학습 모델에 효과적으로 통합되어 성능을 향상시킬 수 있는가?

주요 결과

  • MSR-VTT 벤치마크에서 제안된 이중 인코딩 방법은 평균 평균 정확도(mAP) 0.232를 달성하여 이전 최고 기록을 초월한다.
  • TRECVID 2016 및 2017 애드혹 비디오 검색 과제에서 이 방법은 새로운 최고 기록을 수립하였으며, 복잡하고 실제 세계적인 쿼리에 대한 뛰어난 일반화 능력을 입증한다.
  • MSVD 데이터셋에서 이 방법은 mAP 0.232를 달성하여 교차 데이터셋 평가 시나리오에서 강력한 성능을 보였다.
  • MPII-MD 데이터셋에서 이 방법은 mAP 0.037를 기록하여 비교된 모든 모델 중에서 가장 높은 성능을 보였으며, 영화 설명 검색에서의 효과성을 시사한다.
  • Flickr30K 및 MSCOCO에서 이미지-텍스트 검색을 위한 VSE++에 통합했을 때, 다중 수준 텍스트 인코딩은 Flickr30K에서 R@1을 1.6% 향상시키고 R@10을 4.4% 향상시켰으며, MSCOCO에서는 각각 1.1%와 1.6% 향상되었다.
  • 검색 시스템은 실시간 성능을 달성하였으며, 표준 하드웨어에서 335,944개의 비디오로 구성된 데이터셋을 약 0.14초 내에 쿼리당 처리할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.