Skip to main content
QUICK REVIEW

[論文レビュー] Learning Viewpoint-Agnostic Visual Representations by Recovering Tokens in 3D Space

Jinghuan Shang, Srijan Das|arXiv (Cornell University)|Jun 23, 2022
Advanced Vision and Imaging被引用数 5
ひとこと要約

本論文は、自己教師付き疑似深度と学習可能なカメラ行列を用いて3次元位置埋め込みを推定することで、視覚的Transformerの性能を向上させる、プラグアンドプレイ型モジュールである3Dトークン表現層(3DTRL)を提案する。このアプローチにより、視点に依存しない表現が可能となり、画像分類、マルチビュー動画アライメント、アクション認識の各タスクで高い性能を発揮する。計算コストの増加は最小限(2% FLOPs、4%パラメータ)に抑えられる。

ABSTRACT

Humans are remarkably flexible in understanding viewpoint changes due to visual cortex supporting the perception of 3D structure. In contrast, most of the computer vision models that learn visual representation from a pool of 2D images often fail to generalize over novel camera viewpoints. Recently, the vision architectures have shifted towards convolution-free architectures, visual Transformers, which operate on tokens derived from image patches. However, these Transformers do not perform explicit operations to learn viewpoint-agnostic representation for visual understanding. To this end, we propose a 3D Token Representation Layer (3DTRL) that estimates the 3D positional information of the visual tokens and leverages it for learning viewpoint-agnostic representations. The key elements of 3DTRL include a pseudo-depth estimator and a learned camera matrix to impose geometric transformations on the tokens, trained in an unsupervised fashion. These enable 3DTRL to recover the 3D positional information of the tokens from 2D patches. In practice, 3DTRL is easily plugged-in into a Transformer. Our experiments demonstrate the effectiveness of 3DTRL in many vision tasks including image classification, multi-view video alignment, and action recognition. The models with 3DTRL outperform their backbone Transformers in all the tasks with minimal added computation. Our code is available at https://github.com/elicassion/3DTRL.

研究の動機と目的

  • 2次元位置埋め込みに依存する視覚的Transformerが、新しいカメラの視点に一般化できないという限界を解消すること。
  • 3次元の教師信号や高価な3次元アノテーションを必要とせずに、視点に依存しない視覚的表現を学習する手法を開発すること。
  • 自己教師学習により2次元画像から3次元トークン位置を回復することで、視覚的モデルが2次元画像から3次元シーン構造を暗黙的に理解できるようにすること。
  • 既存のTransformerアーキテクチャにスムーズに統合できる軽量で微分可能なモジュールを設計すること。
  • 3DTRLの有効性を、画像分類、マルチビュー動画アライメント、アクション認識を含む多様なビジョンタスクにおいて実証すること。

提案手法

  • Transformerブロックの間に作用し、入力/出力トークンの次元を維持する3Dトークン表現層(3DTRL)を導入する。
  • 疑似深度推定器を用いて、各画像パッチトークンの深度を予測し、2次元トークンをカメラ中心座標系における3次元座標に変換する。
  • 学習可能なネットワークを用いてカメラ行列(内蔵パラメータと外挿パラメータ)を推定し、カメラ中心座標系の3次元座標を世界座標系の絶対的位置に変換する。
  • 推定されたカメラ行列と深度を用いて幾何変換を適用し、2次元画像パッチから3次元世界座標を回復する。
  • 回復された3次元位置埋め込みを、Transformerのアテンション機構に追加の位置埋め込みとして統合する。
  • 真の3次元データを必要とせず、3次元トークン位置の再構成損失を用いて、無教師学習でモジュール全体を訓練する。

実験結果

リサーチクエスチョン

  • RQ13次元の教師信号を用いずに、2次元画像パッチから有効に3次元幾何的情報を回復できるか? これにより視点一般化性能が向上するか?
  • RQ23次元位置埋め込みをどのように学習し、視覚的Transformerに統合することで、視点変化に対するロバストネスが向上するか?
  • RQ33DTRLを用いて3次元構造を組み込むことで、画像および動画理解タスクの性能がどの程度向上するか?
  • RQ4TimeSformerのような動画モデルに対しても、3DTRLは効果的に適用可能であり、効率性と性能を維持できるか?
  • RQ5大規模な2次元動画データ(例:Kinetics-400)で事前学習することで、3DTRLの下流タスクへの一般化性能がさらに向上するか?

主な発見

  • ImageNet-1Kにおける画像分類タスクで、ResNet-50およびViT-baseモデルがそれぞれのバックボーンモデルよりも高いトップ-1精度を達成した。
  • マルチビュー動画アライメントタスクにおいて、3DTRLは5つのベンチマークデータセット(UCF101-24およびHMDB51を含む)でベースラインのViTおよびTimeSformerモデルを上回った。
  • クロスビュー行動認識タスクでは、SmarthomeおよびNTU60データセットで最先端の性能を達成し、ベースラインのTimeSformerに比べて最大4.5%の向上を示した。
  • バックボーンに追加される計算コストはわずか2%のFLOPs増加、パラメータは4%増加に抑えられ、高い効率性とスケーラビリティを示した。
  • Kinetics-400で3DTRLを事前学習することで、特にラベル付きデータが限られる状況下でも、下流タスクの行動認識性能が顕著に向上した。
  • アブレーションスタディの結果、疑似深度推定器とカメラ行列推定の両方が、3次元表現回復および視点不変性の実現において不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。