Skip to main content
QUICK REVIEW

[논문 리뷰] Video retrieval based on deep convolutional neural network

Yj Dong, JG Li|arXiv (Cornell University)|2017. 12. 01.
Human Pose and Action Recognition참고 문헌 1인용 수 3
한 줄 요약

이 논문은 효율적인 유사도 검색을 위해 깊이 있는 합성곱 신경망(CNN)과 이진 해시 함수를 결합한 엔드 투 엔드 딥 러닝 프레임워크를 제안한다. 삼중체 손실과 분류 손실을 통합함으로써, 고수준의 의미적 특징과 압축된 이진 코드를 학습하며, 두 개의 공개 데이터셋에서 최신 기술을 능가한다.

ABSTRACT

Recently, with the enormous growth of online videos, fast video retrieval research has received increasing attention. As an extension of image hashing techniques, traditional video hashing methods mainly depend on hand-crafted features and transform the real-valued features into binary hash codes. As videos provide far more diverse and complex visual information than images, extracting features from videos is much more challenging than that from images. Therefore, high-level semantic features to represent videos are needed rather than low-level hand-crafted methods. In this paper, a deep convolutional neural network is proposed to extract high-level semantic features and a binary hash function is then integrated into this framework to achieve an end-to-end optimization. Particularly, our approach also combines triplet loss function which preserves the relative similarity and difference of videos and classification loss function as the optimization objective. Experiments have been performed on two public datasets and the results demonstrate the superiority of our proposed method compared with other state-of-the-art video retrieval methods.

연구 동기 및 목표

  • growing 비디오 데이터에 대비하여 효율적이고 정확한 비디오 검색을 해결하기 위해.
  • 수작업으로 만든 특징에 의존하고 의미적 이해가 부족한 전통적인 비디오 해싱의 한계를 극복하기 위해.
  • 딥 뉴럴 네트워크를 사용하여 비디오에서 고수준의 의미적 표현을 학습하기 위해.
  • 특징 학습과 이진 해싱의 엔드 투 엔드 최적화를 통해 검색 성능을 향상시키기 위해.
  • 삼중체 손실과 분류 손실을 활용하여 비디오 검색에서 유사도 유지 능력을 향상시키기 위해.

제안 방법

  • 비디오 프레임에서 고수준의 의미적 특징을 추출하기 위해 깊이 있는 합성곱 신경망을 사용한다.
  • 비디오 특징의 압축적이고 효율적인 표현을 위해 네트워크에 이진 해시 함수를 통합한다.
  • 삼중체 손실과 분류 손실을 포함한 병합된 손실 함수를 사용하여 프레임워크를 엔드 투 엔드로 훈련한다.
  • 삼중체 손실은 앵커, 양성 및 부정 샘플을 비교하여 비디오 간의 상대적인 유사도와 이질성을 유지한다.
  • 분류 손실은 훈련 중에 올바른 비디오 레이블을 할당하여 특징 학습의 구분 능력을 보장한다.
  • 특징 추출과 해시 코드 생성을 공동 최적화하여 검색 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 학습이 가능한 깊이 있는 CNN은 기존 수작업 특징 기반 방법에 비해 비디오 검색 성능을 향상시킬 수 있는가?
  • RQ2삼중체 손실과 분류 손실의 조합은 비디오 데이터의 의미 관계를 얼마나 효과적으로 유지하는가?
  • RQ3학습된 특징을 활용한 이진 해싱은 검색 효율성과 정확도를 어느 정도 향상시키는가?
  • RQ4제안된 방법은 벤치마크 데이터셋에서 기존 최신 기술 대비 슈퍼리어한 성능을 보이는가?
  • RQ5비디오 콘텐츠와 복잡성의 변화에 대해 이 방법은 얼마나 강건한가?

주요 결과

  • 제안된 방법은 두 개의 공개 데이터셋에서 최신 기술 대비 뛰어난 검색 성능을 달성한다.
  • 삼중체 손실과 분류 손실의 통합은 비디오 간 의미 유사도 유지 능력이 크게 향상됨을 입증한다.
  • 딥 CNN과 이진 해시 함수의 엔드 투 엔드 훈련은 더 구분력 있고 압축된 비디오 표현을 가능하게 한다.
  • 학습된 이진 코드 덕분에 모델은 뛰어난 일반화 능력과 효율성을 보이며, 빠른 유사도 검색을 가능하게 한다.
  • 벤치마크 데이터셋에서의 정량적 결과는 평균 평균 정밀도와 검색 정확도 측면에서 제안된 프레임워크의 효과성을 확인한다.
  • 의도적인 최적화를 통해 깊이 있는 의미적 특징을 활용함으로써, 이전의 해싱 기반 접근법을 능가하는 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.