Skip to main content
QUICK REVIEW

[論文レビュー] Depth Estimation with Simplified Transformer

John Yang, Le An|arXiv (Cornell University)|Apr 28, 2022
CCD and CMOS Imaging Sensors被引用数 11
ひとこと要約

本稿では、自己教師付き単眼深度推定を目的とした、軽量でハードウェアに優しいビジョントランスフォーマー「Depth Estimation with Simplified Transformer (DEST)」を提案する。戦略的なアーキテクチャの簡素化と、深度とポーズネットワーク間の共同注意メカニズムを採用することで、SOTAと比較してモデルサイズを85%削減し、推論遅延を最大86%まで低減した。同時にKITTIでは優れた精度を達成し、セマンティックセグメンテーションへの一般化性能も向上させ、速度と性能の両面で優れた結果を得た。

ABSTRACT

Transformer and its variants have shown state-of-the-art results in many vision tasks recently, ranging from image classification to dense prediction. Despite of their success, limited work has been reported on improving the model efficiency for deployment in latency-critical applications, such as autonomous driving and robotic navigation. In this paper, we aim at improving upon the existing transformers in vision, and propose a method for self-supervised monocular Depth Estimation with Simplified Transformer (DEST), which is efficient and particularly suitable for deployment on GPU-based platforms. Through strategic design choices, our model leads to significant reduction in model size, complexity, as well as inference latency, while achieving superior accuracy as compared to state-of-the-art. We also show that our design generalize well to other dense prediction task without bells and whistles.

研究の動機と目的

  • リアルタイム応用における既存のビジョントランスフォーマーの高い計算コストと遅延を解消すること。
  • GPUプラットフォームで効率的かつハードウェアにやさしい、簡素化されたトランスフォーマー・アーキテクチャを設計すること。
  • 大規模な真値深度ラベルに依存せずに、自己教師付き深度推定の精度を向上させること。
  • 提案されたアーキテクチャが、セマンティックセグメンテーションなどの他の密度予測タスクへ一般化できることを実現すること。
  • 最小限のパラメータ数と推論遅延で、深度推定分野における最先端の性能を達成すること。

提案手法

  • 計算複雑性を低減するために、基本的な演算(自己注意、フィードフォワードネットワーク)のみを有する簡素化されたトランスフォーマー・エンコーダーを採用する。
  • 深度ネットワークからの特徴を用いてポーズネットワークの注意を計算する、共同注意メカニズムを導入し、特徴学習を強化する。
  • 二重ストリーム学習設定を採用:単眼動画シーケンスからの光度再構成損失を用いて、Depth-Net と Pose-Net を同時に学習する。
  • モデルバリアント(B0からB5)を設計し、深さと幅を段階的に増加させる。具体的には、(2,2,2,2) などの特定のブロック構成と特徴マップチャネル数を用いる。
  • 推論ではDepth-Netのみを用い、学習後はPose-Netを破棄することで、効率的なデプロイメントを実現する。
  • ImageNet や CityScapes での事前学習の有無を評価し、推論速度を向上させるために TensorRT を最適化に用いる。

実験結果

リサーチクエスチョン

  • RQ1簡素化されたトランスフォーマー・アーキテクチャは、モデルサイズと推論遅延を顕著に削減しながら、最先端の深度推定精度を達成できるか?
  • RQ2深度とポーズネットワーク間の共同注意メカニズムは、特徴表現と予測精度をどのように向上させるか?
  • RQ3提案されたアーキテクチャは、セマンティックセグメンテーションなどの他の密度予測タスクへどの程度一般化できるか?
  • RQ4ハードウェアに配慮した設計選択は、精度を損なわずにGPUプラットフォームでの遅延をどの程度低減できるか?
  • RQ5さまざまな深度推定ベンチマークにおいて、モデル効率(パラメータ数、MACs)と性能のトレードオフはどのようなものか?

主な発見

  • DEST-B3はPackNet-SfMと比較して、モデルパラメータを85%削減し、GMACsを90%削減しながら、KITTIの大多数の指標でそれを上回った。
  • 最小のモデルであるDEST-B0でさえ、その極めて小型なサイズにもかかわらず、競争力ある深度推定精度を達成しており、優れた一般化性能を示した。
  • TensorRTを用い、FP16精度でV100 GPU上で推論遅延を8.87msまで低下させ、PackNet-SfMのPyTorchでの64.76msと比較して86%の低減を達成した。
  • DEST-B3は、18.08Mパラメータと142.78 GMACsで、CityScapesセマンティックセグメンテーションで72.58%のmIoUを達成し、SegFormer-B3よりも精度が高く、遅延を59%削減した。
  • 共同注意メカニズムは、このコンponentを含まないベースラインのSegFormer-B3と比較して、深度推定精度を顕著に向上させた。
  • モデルはセマンティックセグメンテーションへも効果的に一般化され、SegFormer-B3よりもはるかに少ないパラメータ数と低い遅延で、より高いmIoUを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。