[論文レビュー] simCrossTrans: A Simple Cross-Modality Transfer Learning for Object Detection with ConvNets or Vision Transformers
本論文では、点群から抽出した疑似画像を用いて事前学習済み2Dモデル(ConvNets や Vision Transformers)を微調整することで、3D深度のみの物体検出を可能にするシンプルなクロスモダリティ転移学習手法、simCrossTransを提案する。ViTを用いた場合、ベースライン手法比でmAP50が16.1%向上し、以前のSOTAを15.4%上回り、RGBのみのSOTAとわずか1%の差で近づいた。
Transfer learning is widely used in computer vision (CV), natural language processing (NLP) and achieves great success. Most transfer learning systems are based on the same modality (e.g. RGB image in CV and text in NLP). However, the cross-modality transfer learning (CMTL) systems are scarce. In this work, we study CMTL from 2D to 3D sensor to explore the upper bound performance of 3D sensor only systems, which play critical roles in robotic navigation and perform well in low light scenarios. While most CMTL pipelines from 2D to 3D vision are complicated and based on Convolutional Neural Networks (ConvNets), ours is easy to implement, expand and based on both ConvNets and Vision transformers(ViTs): 1) By converting point clouds to pseudo-images, we can use an almost identical network from pre-trained models based on 2D images. This makes our system easy to implement and expand. 2) Recently ViTs have been showing good performance and robustness to occlusions, one of the key reasons for poor performance of 3D vision systems. We explored both ViT and ConvNet with similar model sizes to investigate the performance difference. We name our approach simCrossTrans: simple cross-modality transfer learning with ConvNets or ViTs. Experiments on SUN RGB-D dataset show: with simCrossTrans we achieve $13.2\%$ and $16.1\%$ absolute performance gain based on ConvNets and ViTs separately. We also observed the ViTs based performs $9.7\%$ better than the ConvNets one, showing the power of simCrossTrans with ViT. simCrossTrans with ViTs surpasses the previous state-of-the-art (SOTA) by a large margin of $+15.4\%$ mAP50. Compared with the previous 2D detection SOTA based RGB images, our depth image only system only has a $1\%$ gap. The code, training/inference logs and models are publicly available at https://github.com/liketheflower/simCrossTrans
研究の動機と目的
- 低照度またはプライバシー制約のある環境における3Dセンサーのみの物体検出システムの上限性能を調査すること。
- 2D RGB画像と3D点群の間のモダリティギャップを、転移学習を用いて埋めることで、物体検出精度の向上を図ること。
- 深度ベースの物体検出における、Vision Transformers(ViTs)がConvNetsを上回るかを評価すること。
- 既存の2D事前学習モデルをアーキテクチャの変更なしに再利用できる、シンプルで拡張可能でモジュラーなフレームワークを開発すること。
提案手法
- 3D点群を投影ベース変換により疑似2D画像に変換し、2D事前学習モデルとの互換性を確保する。
- 2Dビジョンで用いられるのと同じトレーニングパイプラインを用いて、事前学習済み2Dモデル(ResNet-50 および Swin-T)を疑似2D深度画像上で微調整する。
- ConvNetとViTの両バックボーンに同一のモデルアーキテクチャとハイパーパramータを適用し、公平な比較を実現する。
- 微調整済みバックボーンの上に標準的な物体検出ヘッドを設け、深度のみのデータに対する推論を実行する。
- 2D ImageNetスタイルの事前学習で得た文脈的・空間的事前知識を活用し、3Dのみの検出における特徴表現を向上させる。
- 特徴可視化とヒストグラム解析を用いて、クロスモダリティ微調整後のConvNetsとViTsの内部表現を比較する。
実験結果
リサーチクエスチョン
- RQ12D RGB画像から3D深度画像へのクロスモダリティ転移学習が、深度のみのシステムにおける物体検出性能を顕著に向上させ得るか?
- RQ23D物体検出におけるクロスモダリティ転移学習において、Vision TransformersとConvNetsの性能はどのように比較されるか?
- RQ3事前学習済み2Dモデルが、疑似画像変換と微調整を経て、深度のみのデータにどの程度一般化可能か?
- RQ4ソースモダリティで自己教師あり事前学習を用いることで、ターゲットモダリティにおける転移性能がさらに向上するか?
主な発見
- ResNet-50をバックボーンとして用いた場合、simCrossTransはベースライン比でmAP50が13.2%絶対的に向上した。
- Swin-Tをバックボーンとして用いた場合、simCrossTransはmAP50で16.1%の絶対的向上を達成し、以前のSOTAを+15.4%上回った。
- 同じトレーニング設定下で、Vision TransformersはConvNetsをmAP50で9.7%上回り、クロスモダリティ転移における優位性を示した。
- 本手法により、深度のみとRGBのみの検出システム間の性能差がわずか1% mAP50にまで縮小され、優れた一般化性能が示された。
- ラップトップ、キーボード、スツールといった難易度の高いカテゴリが、simCrossTransにより最も恩恵を受け、2D事前学習による文脈的事前知識が低信号状況でも有効であることが示された。
- 特徴可視化の結果、ViTではより密で構造的な特徴マップが得られた一方、ConvNetsは疎な出力が見られた。これは、アテンションメカニズムがより優れた特徴学習を可能にしていることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。