Skip to main content
QUICK REVIEW

[論文レビュー] AugUndo: Scaling Up Augmentations for Monocular Depth Completion and Estimation

Yangchao Wu, Tian Yu Liu|arXiv (Cornell University)|Oct 15, 2023
Advanced Vision and ImagingComputer Science被引用数 3
ひとこと要約

本論文では、出力空間における幾何変換の'元に戻す'処理により、教師なし単眼深度補完における広範な光度的および幾何的データオーグメンテーションを可能にする新しいフレームワーク、AugUndoを提案する。予測された深度マップを再構成損失を計算する前に元の座標フレームにワープすることで、AugUndoはオーグメンテーションに起因するアーティファクトを排除しつつ、監視品質を維持する。既存の手法に適用した場合、屋内(VOID)および屋外(KITTI)ベンチマークで平均11.75%の性能向上を達成する。

ABSTRACT

Unsupervised depth completion and estimation methods are trained by minimizing reconstruction error. Block artifacts from resampling, intensity saturation, and occlusions are amongst the many undesirable by-products of common data augmentation schemes that affect image reconstruction quality, and thus the training signal. Hence, typical augmentations on images viewed as essential to training pipelines in other vision tasks have seen limited use beyond small image intensity changes and flipping. The sparse depth modality in depth completion have seen even less use as intensity transformations alter the scale of the 3D scene, and geometric transformations may decimate the sparse points during resampling. We propose a method that unlocks a wide range of previously-infeasible geometric augmentations for unsupervised depth completion and estimation. This is achieved by reversing, or ``undo''-ing, geometric transformations to the coordinates of the output depth, warping the depth map back to the original reference frame. This enables computing the reconstruction losses using the original images and sparse depth maps, eliminating the pitfalls of naive loss computation on the augmented inputs and allowing us to scale up augmentations to boost performance. We demonstrate our method on indoor (VOID) and outdoor (KITTI) datasets, where we consistently improve upon recent methods across both datasets as well as generalization to four other datasets. Code available at: https://github.com/alexklwong/augundo.

研究の動機と目的

  • 光度的および幾何的変換による再構成アーティファクトのため、教師なし深度補完におけるデータオーグメンテーションの利用が制限されている問題に対処すること。
  • 標準的なオーグメンテーションが引き起こすリサンプリング、強度の飽和、オクルージョンに起因する監視信号の劣化を克服すること。
  • 逆変換によりモデルの予測を元の入力座標に合わせることで、従来不可能とされてきた広範な幾何的オーグメンテーションの利用を可能にすること。
  • 訓練中に多様な不快な変動にさらされることで、モデルの汎化性能および耐性を向上させること。
  • アーキテクチャの変更や顕著な計算負荷の増加なしに、既存の深度補完モデルを強化できるプラグアンドプレイソリューションを提供すること。

提案手法

  • 訓練中に入力画像およびスパarsな深度マップに光度的および幾何的オーグメンテーション(例:明るさ、コントラスト、回転、反転、リサイズ)を適用する。
  • オーグメンテーションを施した入力からのアーティファクトを避けるために、元の未変更の画像およびスパース深度マップを用いて再構成損失を計算する。
  • 適用された幾何的変換の逆変換を用いて、オーグメント済み入力からの予測深度マップを元の座標フレームにワープする。
  • このワープ処理により、モデルの出力が真の監視ターゲットと整合され、オーグメンテーションの影響にもかかわらず正確な損失計算が可能になる。
  • グループベースの変換(例:回転、平行移動)および非グループ変換(例:オクルージョン)の両方をサポートし、11種類のオーグメンテーションタイプの組み合わせに関するアブレーションを実施する。
  • 任意の既存の教師なし深度補完モデルと互換性があり、訓練コストはほとんど増加しない。

実験結果

リサーチクエスチョン

  • RQ1モデル出力を逆ワープによって補正することで、従来深度補完において監視品質を低下させる幾何的オーグメンテーションを安全に適用できるか?
  • RQ2光度的および幾何的オーグメンテーションをスケーリングアップすることで、教師なし深度補完の性能向上はどの程度達成できるか?
  • RQ3提案された'元に戻す'メカニズムは、未観測環境へのモデルの汎化性能を保持または向上させるか?
  • RQ4異なるオーグメンテーションの組み合わせが、多様なデータセット上でモデルの性能にどのように影響を与えるか?
  • RQ5本手法は、アーキテクチャの変更や顕著な訓練コストの増加なしに、既存の深度補完モデルに普遍的に適用可能か?

主な発見

  • AugUndoは、VOIDデータセットにおける全評価モデル(Monodepth2、HR-Depth、Lite-Mono)を向上させ、屋内および屋外ベンチマーク全体で平均11.75%の性能向上を達成した。
  • VOIDにおいて、最も挑戦的な指標δ<1.25は、Monodepth2で0.717から0.724に、HR-Depthで0.714から0.718に、Lite-Monoで0.669から0.674に向上した。
  • VOIDにおけるAbs Rel指標では、Monodepth2が0.183から0.178に、HR-Depthが0.185から0.181に、Lite-Monoが0.209から0.200に改善した。
  • NYUv2およびScanNetへのゼロショット一般化では一貫した改善が得られた:Monodepth2のRMSEはNYUv2で0.556から0.537に、ScanNetで0.368から0.351に低下した。
  • KITTIでは、AugUndoによりMonodepth2のδ<1.25が0.869から0.879に、HR-Depthが0.879から0.883に、Lite-Monoが0.862から0.863に向上した。
  • 本手法は、Lite-MonoがHR-Depthを上回る改善、HR-DepthがPackNetを上回る改善といった、次世代の最先端モデルの改善と同等の性能向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。