Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised Feature Learning by Cross-modality and Cross-view Correspondences

Longlong Jing, Yu‐Cheng Chen|arXiv (Cornell University)|Apr 13, 2020
3D Shape Modeling and Analysis参考文献 58被引用数 6
ひとこと要約

本論文は、人間によるラベルなしで、2次元画像と3次元点群の特徴を、相互モodal(画像対点群)および相互ビュー(同じ物体の異なる2次元ビュー)の対応関係を活用して共同で学習する自己教師あり学習フレームワークを提案する。手法は2次元CNNと3次元GCNを用いて特徴を抽出し、相互モダリティマッチングのための対照的損失と、相互ビューの一貫性のための対照的損失により同時に学習させ、3次元形状認識(89.8%の正確度)で最先端の性能を達成し、複数の下流タスクにおいても優れた結果を示す。

ABSTRACT

The success of supervised learning requires large-scale ground truth labels which are very expensive, time-consuming, or may need special skills to annotate. To address this issue, many self- or un-supervised methods are developed. Unlike most existing self-supervised methods to learn only 2D image features or only 3D point cloud features, this paper presents a novel and effective self-supervised learning approach to jointly learn both 2D image features and 3D point cloud features by exploiting cross-modality and cross-view correspondences without using any human annotated labels. Specifically, 2D image features of rendered images from different views are extracted by a 2D convolutional neural network, and 3D point cloud features are extracted by a graph convolution neural network. Two types of features are fed into a two-layer fully connected neural network to estimate the cross-modality correspondence. The three networks are jointly trained (i.e. cross-modality) by verifying whether two sampled data of different modalities belong to the same object, meanwhile, the 2D convolutional neural network is additionally optimized through minimizing intra-object distance while maximizing inter-object distance of rendered images in different views (i.e. cross-view). The effectiveness of the learned 2D and 3D features is evaluated by transferring them on five different tasks including multi-view 2D shape recognition, 3D shape recognition, multi-view 2D shape retrieval, 3D shape retrieval, and 3D part-segmentation. Extensive evaluations on all the five different tasks across different datasets demonstrate strong generalization and effectiveness of the learned 2D and 3D features by the proposed self-supervised method.

研究の動機と目的

  • 3次元コンピュータビジョンにおける教師あり学習のための、大規模な3次元および2次元データセットのラベル付けにかかる高コストを軽減すること。
  • 人間によるラベルに依存せずに、識別的な2次元および3次元視覚的特徴を学習すること。
  • 3次元データにおける相互モダリティおよび相互ビューの対応関係を同時に最適化することで、特徴の一般化を向上させること。
  • 認識、検索、パーツセグメンテーションを含む多様な下流タスクにおいて、学習された特徴を評価すること。
  • 自己教師あり事前学習が、限定的なデータで微調整された場合に、教師あり性能と同等またはそれを上回ることを示すこと。

提案手法

  • 入力モダリティとして、同一の3次元メッシュからレンダリングされたマルチビュー画像と3次元点群を用いる。
  • 2次元畳み込みニューラルネットワーク(CNN)が、同じ3次元オブジェクトの異なるビューからレンダリングされた2次元画像から特徴を抽出する。
  • グラフ畳み込みニューラルネットワーク(GCN)が、3次元点群データから直接特徴を抽出する。
  • 2層の全結合ネットワークが、2次元画像と3次元点群特徴間の相互モダリティ対応関係を予測する。
  • 2つの対照的損失を用いてモデルを訓練する:1つは相互モダリティマッチング(同じオブジェクト対異なるオブジェクト)のため、もう1つは相互ビューの一貫性(2次元画像特徴におけるオブジェクト内距離を最小化し、オブジェクト間距離を最大化)のため。
  • すべてのプロセスは、人間によるラベルなしで、エンド・ツー・エンドの誤差逆伝播により一括最適化される。

実験結果

リサーチクエスチョン

  • RQ12次元画像と3次元点群の間の相互モダリティ対応関係は、自己教師あり特徴学習のための効果的な教師信号として利用可能か?
  • RQ2同じ3次元オブジェクトの複数の2次元ビュー間の相互ビュー対応関係は、ラベルなしで2次元特徴学習をさらに向上させられるか?
  • RQ3相互モダリティおよび相互ビューの両方の対応関係を同時に最適化することで、より一般化可能な2次元および3次元特徴が得られるか?
  • RQ4自己教師ありモデルの性能は、3次元認識および検索タスクにおいて、教師ありおよび非教師ありベースラインと比べてどうか?
  • RQ5微調整時に限定的なデータを用いた場合、事前学習された特徴は3次元パーツセグメンテーションなどの下流タスクにうまく一般化できるか?

主な発見

  • 提案手法は、自己教師あり事前学習のみを用いて3次元形状認識(ModelNet40)で89.8%のトップ1正確度を達成し、すべての先行非教師あり手法を上回った。
  • 限定的なデータで微調整した場合、PointNet++などの最先端の教師あり手法と同等の性能を達成し、データの2%しか使用しない場合でさえ、教師ありベースラインを上回った。
  • マルチビュー2次元形状認識において、80ビューで89.3%の正確度を達成し、80ビューの教師ありMVCNNに近い性能に到達した。
  • 小規模な3次元データセットで微調整した場合、事前学習された3次元特徴抽出器($F_p$)は、データの2%しか使用しなくても、教師あり設定に比べて+5.0%のインスタンスmIOUおよび+4.5%のクラスmIOUを達成した。
  • 相互モダリティおよび相互ビューの監視を併用することで、5つの異なるタスク(2次元/3次元認識、検索、3次元パーツセグメンテーション)において、より強固で一般化性の高い特徴が得られることを実証した。
  • アブレーションスタディにより、両方の損失(相互モダリティおよび相互ビュー)が不可欠であることが確認され、いずれかを除去すると性能が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。