Skip to main content
QUICK REVIEW

[論文レビュー] Deep Triplet Neural Networks with Cluster-CCA for Audio-Visual Cross-modal Retrieval

Donghuo Zeng, Yi Yu|arXiv (Cornell University)|Aug 10, 2019
Advanced Image and Video Retrieval Techniques参考文献 65被引用数 4
ひとこと要約

本稿では、三重項損失とクラスターラインアレイCCA(C-CCA)を組み合わせることで、音声と映像のモダリティ間の相関を最大化し、正例と負例のペアを区別するように学習する、共同埋め込みを判別的に学習するための深層三重項ニューラルネットワーク(TNN-C-CCA)を提案する。この手法は、2つのデータセットにおいて6つのCCAベースの手法および4つの最先端のクロスモーダルリtrieval手法を上回り、10個の相関成分を用いた音声から映像へのリtrievalで74.66%、映像から音声へのリtrievalで73.77%のMAPを達成した。

ABSTRACT

Cross-modal retrieval aims to retrieve data in one modality by a query in another modality, which has been a very interesting research issue in the field of multimedia, information retrieval, and computer vision, and database. Most existing works focus on cross-modal retrieval between text-image, text-video, and lyrics-audio.Little research addresses cross-modal retrieval between audio and video due to limited audio-video paired datasets and semantic information. The main challenge of audio-visual cross-modal retrieval task focuses on learning joint embeddings from a shared subspace for computing the similarity across different modalities, where generating new representations is to maximize the correlation between audio and visual modalities space. In this work, we propose a novel deep triplet neural network with cluster canonical correlation analysis(TNN-C-CCA), which is an end-to-end supervised learning architecture with audio branch and video branch.We not only consider the matching pairs in the common space but also compute the mismatching pairs when maximizing the correlation. In particular, two significant contributions are made: i) a better representation by constructing deep triplet neural network with triplet loss for optimal projections can be generated to maximize correlation in the shared subspace. ii) positive examples and negative examples are used in the learning stage to improve the capability of embedding learning between audio and video. Our experiment is run over 5-fold cross-validation, where average performance is applied to demonstrate the performance of audio-video cross-modal retrieval. The experimental results achieved on two different audio-visual datasets show the proposed learning architecture with two branches outperforms existing six CCA-based methods and four state-of-the-art based cross-modal retrieval methods.

研究の動機と目的

  • ペairedデータセットの限界と意味的情報の不足による音声・映像クロスモーダルリtrieval分野における研究の不足に対処すること。
  • 共有部分空間内で音声と映像モダリティ間の相関を最大化する共同埋め込みを学習すること。
  • 三重項損失を用いて正例と負例の両方を組み込むことで表現学習を向上させること。
  • ペアワイズの一致にとどまらず、同じカテゴリに属するすべてのサンプル間の意味的情報を保持すること。
  • 既存のCCAベースおよびクロスモーダルリtrieval手法を上回るエンドツーエンドの教師ありアーキテクチャを開発すること。

提案手法

  • 正例ペア間の類似性を最適化し、負例ペア間の類似性を最小化することで、判別可能な埋め込みを学習するための三重項損失を用いた深層三重項ニューラルネットワーク(TNN)を提案する。
  • すべてのクロスモーダルデータペア間の1対1対応関係を強制し、共有部分空間内で相関を最大化することで、共同表現を学習するためのクラスターラインアレイCCA(C-CCA)を統合する。
  • 音声と映像の両ブランチを別々に処理する二重ブランチアーキテクチャを採用し、特徴抽出のための事前学習済み深層CNNを各ブランチに適用する。
  • マージンベースの三重項損失関数を適用し、正例ペア間の距離が負例ペア間の距離よりも少なくともマージン以上小さくなるように制約を課す。
  • 音声と映像の特徴が最大の正規化相関を達成するようにマッピングされる共有プロジェクション空間を採用し、相関成分の数によって次元を制御する。
  • ハイパーパramータチューニングを実施するため、マージンとバッチサイズを最適化する目的で5-foldクロスバリデーションを実施する。

実験結果

リサーチクエスチョン

  • RQ1三重項ネットワークとクラスターラインアレイCCAを併用することで、ペアワイズおよび非ペアワイズの意味的関係を同時にモデル化することにより、音声・映像クロスモーダルリtrievalが向上するか?
  • RQ2三重項損失に負例ペアを組み込むことで、標準的なCCAやDCCAと比較して、学習された埋め込みの判別力がどのように向上するか?
  • RQ3音声・映像リtrievalにおけるクラスターラインアレイCCAの最適な相関成分の数は何か?また、その数が性能に与える影響は?
  • RQ4マージンやバッチサイズなどのハイパーパrameterが、モデルのMAP性能にどのように影響するか?
  • RQ5提案されたTNN-C-CCAアーキテクチャは、実世界の音声・映像データセットにおいて、既存のCCAベースおよび最先端のクロスモーダルリtrieval手法を上回ることができるか?

主な発見

  • 提案されたTNN-C-CCAモデルは、10個の相関成分を用いた場合、音声から映像へのリtrievalで74.66%、映像から音声へのリtrievalで73.77%の平均平均精度(MAP)を達成した。
  • 本モデルは、2種類の異なる音声・映像データセットにおいて、6つのCCAベースの手法および4つの最先端のクロスモーダルリtrieval手法を上回った。
  • 最適な性能はバッチサイズ400、マージン0.5で達成され、800バッチを超えると過学習または不安定性のため性能が著しく低下した。
  • 相関成分の数は性能に強く影響し、10個の成分で最高のMAPが得られたが、50個の成分では性能が急激に低下した。
  • バッチサイズ30(700バッチ)のモデルでは、300バッチのときと比較して学習時間を3時間に短縮したが、高い性能を維持した。
  • アブレーションスタディの結果、正例と負例の両方を含む三重項損失が、ペアワイズ相関のみに依存するモデルと比較して、埋め込み品質を顕著に向上させたことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。