Skip to main content
QUICK REVIEW

[論文レビュー] Multiple Discrimination and Pairwise CNN for View-based 3D Object Retrieval

Zan Gao, Kaixin Xue|arXiv (Cornell University)|Feb 27, 2020
Advanced Image and Video Retrieval Techniques参考文献 42被引用数 4
ひとこと要約

本稿では、スライス層とコンカット層を用いて複数のバッチと複数のビューを同時に処理することで特徴の識別性を向上させる、新しいペairワイズ CNN フレームワーク MDPCNN を提案する。硬いサンプルのマイニングによるハードサンプルマイニングと、同時最適化されたコントラスト損失およびコントラストセンター損失により、ModelNet40、MVRED、NTU60 データセットで最先端の性能を達成し、mAP の向上が最大 87.6% に達する。

ABSTRACT

With the rapid development and wide application of computer, camera device, network and hardware technology, 3D object (or model) retrieval has attracted widespread attention and it has become a hot research topic in the computer vision domain. Deep learning features already available in 3D object retrieval have been proven to be better than the retrieval performance of hand-crafted features. However, most existing networks do not take into account the impact of multi-view image selection on network training, and the use of contrastive loss alone only forcing the same-class samples to be as close as possible. In this work, a novel solution named Multi-view Discrimination and Pairwise CNN (MDPCNN) for 3D object retrieval is proposed to tackle these issues. It can simultaneously input of multiple batches and multiple views by adding the Slice layer and the Concat layer. Furthermore, a highly discriminative network is obtained by training samples that are not easy to be classified by clustering. Lastly, we deploy the contrastive-center loss and contrastive loss as the optimization objective that has better intra-class compactness and inter-class separability. Large-scale experiments show that the proposed MDPCNN can achieve a significant performance over the state-of-the-art algorithms in 3D object retrieval.

研究の動機と目的

  • 変化する照明条件や視点に応じて性能が不安定になる、手作業で特徴を設計する従来の 3D オブジェクト検索手法の限界を解消すること。
  • 現在のディープラーニングベースの検索ネットワークにおいて、マルチビュー画像選択の考慮不足とクラス間分離性の不十分さを克服すること。
  • エンドツーエンドで、クラス内コンパクト性とクラス間分離性を向上させる、高識別性の CNN アーキテクチャを構築すること。
  • マルチバッチ学習、ハードサンプル選択、および結合損失関数の設計が検索性能に与える影響を調査すること。

提案手法

  • トレーニング中に複数のバッチと複数のビューを同時に入力できるようにするスライス層とコンカット層を用いた、新しいネットワークアーキテクチャ MDPCNN を導入する。
  • クラスタリングに基づくサンプル選択戦略を採用し、識別が難しいサンプルを特定・優先してペアワイズ学習に活用することで、モデルの識別性を向上させる。
  • コントラスト損失とコントラストセンター損失を組み合わせた二重損失関数を適用し、クラス内コンパクト性とクラス間分離性を促進する。
  • 特徴の後処理を回避するエンドツーエンドのトレーニングパラダイムを採用し、検索性能を直接最適化可能にする。
  • 同一 3D オブジェクトの複数のビューから得られる正例・負例ペアを用いたペアワイズ学習を実装し、トレーニングサンプルの多様性を向上させる。
  • 特徴表現をさらに精緻化するために、低ランクのマハラノビス距離学習を用いたファインチューニングを実施する。

実験結果

リサーチクエスチョン

  • RQ1スライス層とコンカット層によるマルチバッチ・マルチビュー入力は、3D オブジェクト検索ネットワークのトレーニングダイナミクスと性能にどのように影響を与えるか?
  • RQ2クラスタリングに基づくハードサンプルマイニングは、ビューベースの 3D 検索におけるモデルの識別性をどの程度向上させるか?
  • RQ3コントラスト損失とコントラストセンター損失の組み合わせは、クラス内コンパクト性とクラス間分離性にどのように寄与するか?
  • RQ4バッチ構造、サンプル選択、損失関数設計の各要素が、全体の検索精度に果たす相対的寄与度は何か?

主な発見

  • MDPCNN は ModelNet40 データセットで平均平均精度(mAP)87.6% を達成し、最先端手法を大きく上回る性能を示した。
  • アブレーションスタディの結果、マルチバッチ構造そのものが単一バッチ学習に比べて性能向上をもたらすことが確認され、ハードサンプル選択によりさらなる向上が得られた。
  • クラスタリングに基づくサンプル選択法は、識別が困難なサンプルに焦点を当てることでモデルの一般化性能を向上させ、明確な性能向上をもたらした。
  • コントラスト損失とコントラストセンター損失の共同最適化により、特に MVRED および NTU60 データセットで特徴の識別性が顕著に向上した。
  • ネットワークは急速に収束し、ETH では 3 エポック、MVRED および NTU60 では 5 エポックで収束を示し、強いトレーニング安定性を示した。
  • 提案手法は ModelNet40、MVRED、NTU60 などの多様なベンチマークデータセットにわたり、強靭性とスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。