Skip to main content
QUICK REVIEW

[論文レビュー] CNN Retrieval based Unsupervised Metric Learning for Near-Duplicated Video Retrieval

Hao Cheng, Ping Wang|arXiv (Cornell University)|May 30, 2021
Advanced Image and Video Retrieval Techniques参考文献 13被引用数 4
ひとこと要約

本論文は、事前学習済みネットワークの途中畳み込み層と全結合層からの特徴を統合するCNNベースの教師なしメトリクス学習フレームワークを提案し、近似同一動画検索(NDVR)に応用する。教師なしメトリクス学習とk近傍法に基づく再ランク戦略を採用することで、CC_WEB_VIDEOデータセットにおいてSOTAのmAP 0.9790を達成した。

ABSTRACT

As important data carriers, the drastically increasing number of multimedia videos often brings many duplicate and near-duplicate videos in the top results of search. Near-duplicate video retrieval (NDVR) can cluster and filter out the redundant contents. In this paper, the proposed NDVR approach extracts the frame-level video representation based on convolutional neural network (CNN) features from fully-connected layer and aggregated intermediate convolutional layers. Unsupervised metric learning is used for similarity measurement and feature matching. An efficient re-ranking algorithm combined with k-nearest neighborhood fuses the retrieval results from two levels of features and further improves the retrieval performance. Extensive experiments on the widely used CC\_WEB\_VIDEO dataset shows that the proposed approach exhibits superior performance over the state-of-the-art.

研究の動機と目的

  • 高密度な冗長性を示す大規模な動画データセットにおける近似同一動画検索の課題に対処する。
  • 途中畳み込み層からの低レベル特徴(LLF)と全結合層からの上位レベル特徴(ULF)を統合することで、動画表現を向上させる。
  • ラベルデータを必要としない教師なしメトリクス学習フレームワークを開発し、動画間の類似度測定を強化する。
  • k近傍法とジャカード距離に基づく効率的な再ランクアルゴリズムを導入し、2つの特徴レベルの結果を統合することで、検索精度を向上させる。

提案手法

  • 最終全結合層出力からのフレーム間差分を用いてキーフレームを抽出し、その後、時間的相関に基づくプルーニングを実施して冗長性を低減する。
  • 多段階動画特徴を抽出する:途中畳み込み層からの低レベル特徴(LLF)と最終全結合層(例:fc7 や pool5)からの上位レベル特徴(ULF)。
  • スパースな文脈的活性化とジャカード距離を用いて、教師なしメトリクス学習によりクエリ動画と候補動画間の類似度を計算する。
  • 各クエリごとに2つのスパースな文脈的活性化ベクトルを構築する:正例集合用に MIN(F_q^fc, F_q^conv)、負例集合用に MAX(F_q^fc, F_q^conv)。
  • 高次元特徴空間における高速なk近傍探索のため、修正版ランダムに投影されたkd-Treeを用いる。
  • LLFとULFの両方のk-NN結果にジャカード距離を適用し、上位のランク統合を実行することで、最終的な検索順位を向上させる。

実験結果

リサーチクエスチョン

  • RQ1事前学習CNNの複数レベルからの特徴統合は、単一レベル特徴の使用と比較して、近似同一動画検索性能を向上させることができるか?
  • RQ2ラベルデータを必要としないスパースな文脈的活性化とジャカード距離を用いた教師なしメトリクス学習は、動画類似度測定においてどの程度有効か?
  • RQ3k近傍法と特徴統合に基づく提案された再ランク戦略は、ベースライン手法と比較して、どの程度検索精度を向上させるか?
  • RQ4CC_WEB_VIDEOベンチマークにおいて、提案手法はmAPおよび精度再現率性能の面で、SOTAのNDVRアプローチと比較してどの程度優れているか?

主な発見

  • 提案されたCNN-UML手法は、CC_WEB_VIDEOデータセットでmAP 0.9790を達成し、比較されたすべてのSOTA手法を上回った。
  • GoogLeNetベースの特徴とランク統合(RankF)が最高のmAP(0.9790)を記録し、多段階特徴統合の有効性を示した。
  • すべてのCNNアーキテクチャにおいて、途中層からの低レベル特徴(LLF)が、全結合層からの上位レベル特徴(ULF)をわずかに上回った。
  • k近傍法とジャカード距離に基づく再ランク戦略は、特にLLFとULF表現を統合した場合に、検索パフォーマンスを顕著に向上させた。
  • 従来の手法(例:CNN-L や MFH)とは異なり、複雑な学習やコードブック生成を必要とせず、優れたパフォーマンスを達成した。
  • PR曲線解析により、提案手法はさまざまな再現率レベルにおいて高い精度を維持しており、堅牢で一貫性のある検索パフォーマンスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。