Skip to main content
QUICK REVIEW

[論文レビュー] 3D-RETR: End-to-End Single and Multi-View 3D Reconstruction with Transformers

Zai Shi, Zhao Meng|arXiv (Cornell University)|Oct 17, 2021
3D Surveying and Cultural Heritage参考文献 50被引用数 9
ひとこと要約

3D-RETR は、事前学習されたビジョン Transformer 編集器、ボクセル特徴の生成にための Transformer デコーダー、および最終的な 3D 出力のための CNN デコーダーを活用して、トランスフォーマーを用いたエンドツーエンドの単一およびマルチビュー 3D 再構成フレームワークを提案する。従来のモデルと比較して大幅に少ないパラメータで最先端の性能を達成する。

ABSTRACT

3D reconstruction aims to reconstruct 3D objects from 2D views. Previous works for 3D reconstruction mainly focus on feature matching between views or using CNNs as backbones. Recently, Transformers have been shown effective in multiple applications of computer vision. However, whether or not Transformers can be used for 3D reconstruction is still unclear. In this paper, we fill this gap by proposing 3D-RETR, which is able to perform end-to-end 3D REconstruction with TRansformers. 3D-RETR first uses a pretrained Transformer to extract visual features from 2D input images. 3D-RETR then uses another Transformer Decoder to obtain the voxel features. A CNN Decoder then takes as input the voxel features to obtain the reconstructed objects. 3D-RETR is capable of 3D reconstruction from a single view or multiple views. Experimental results on two datasets show that 3DRETR reaches state-of-the-art performance on 3D reconstruction. Additional ablation study also demonstrates that 3D-DETR benefits from using Transformers.

研究の動機と目的

  • 単一またはマルチビューの 2D イメージからのエンドツーエンドの 3D 再構成にトランスフォーマーを効果的に活用するというギャップを埋めること。
  • 3D 再構成に適切にトランスフォーマーと CNN を統合する統一されたアーキテクチャを設計すること。
  • 同等のパラメータ予算下で、トランスフォーマーが CNN ベースのバックボーンを上回ることを示すこと。
  • 合成データおよび実世界のデータセットの両方で、提案されたモデルの効率性と有効性を検証すること。

提案手法

  • 事前学習済みのビジョン Transformer 編集器が 2D 入力画像からの視覚的特徴を抽出する。
  • 別個の Transformer デコーダーが画像特徴から 3D ボクセル特徴を生成する。
  • CNN デコーダーがボクセル特徴から最終的な 3D オブジェクトを再構成する。
  • ボクセル占有予測を最適化するために Dice 損失関数を用いてエンドツーエンドでモデルを訓練する。
  • VQ-VAE を用いた二段階アプローチのバリエーションを検討し、離散トークンが Transformer デコーダーによって自己回帰的に生成される。
  • 部品を削減したバージョン(最小限の Transformer デコーダーや置換されたエンコーダーを含む)との比較を含むアブレーションスタディを実施。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマーは、単一またはマルチビューの 2D イメージからのエンドツーエンドの 3D 再構成に効果的に使用可能か?
  • RQ2提案された 3D-RETR アーキテクチャは、CNN ベースのベースラインと比較して、性能およびパラメータ効率の点でどのように差をつけるか?
  • RQ3各コンポONENT(Transformer 編集器、Transformer デコーダー、CNN デコーダー)が最終的な再構成品質に果たす寄与度は何か?
  • RQ4ビジョン Transformer 編集器の事前学習が性能に顕著な向上をもたらすか?
  • RQ5VQ-VAE を用いた二段階アプローチと比較して、エンドツーエンドのトレーニング設定が 3D 再構成において優れているか?

主な発見

  • 3D-RETR は ShapeNet データセットで平均交差率(IoU)0.680 を達成し、従来の最先端モデルを上回る性能を示した。
  • 16300万パラメータしか使用しないにもかかわらず、3D-RETR-B は Pix2Vox++(9800万パラメータ)や Matryoshka(4600万パラメータ)といったより大きなモデルを上回る性能を発揮した。
  • アブレーションスタディの結果、Transformer デコーダーを削除すると IoU は 0.680 から 0.667 に低下し、その必要性が裏付けられた。
  • ビジョン Transformer 編集器を ResNet-50 に置き換えると、性能は 0.680 から 0.670 に低下し、自己注意特徴の優位性が示された。
  • 交差エントロピー損失を Dice 損失に置き換えると性能が低下し、3D 再構成において Dice 損失が最適であることが確認された。
  • 二段階の VQ-VAE バリエーションは、単一段階の 3D-RETR よりも性能が劣り、エンドツーエンドのトレーニングがより効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。