Skip to main content
QUICK REVIEW

[論文レビュー] DiffuVolume: Diffusion Model for Volume based Stereo Matching

Dian Zheng, Xiao-Ming Wu|arXiv (Cornell University)|Aug 30, 2023
Advanced Vision and Imaging被引用数 6
ひとこと要約

DiffuVolumeは、ステレオマッチングのための新しい拡散モデルベースのコストボリュームフィルタを提案する。従来のノイズ注入の代わりに、タスク固有の注意メカニズムに類似した拡散フィルタを用い、反復的に冗長な幾何情報を取り除く。従来の拡散ベース手法と比較して、エンドツーエンド誤差(EPE)を22%低減し、推論速度を240倍高速化する一方で、パラメータはわずか2%増加するだけであり、あらゆるベンチマークで性能向上を達成する。

ABSTRACT

Stereo matching is a significant part in many computer vision tasks and driving-based applications. Recently cost volume-based methods have achieved great success benefiting from the rich geometry information in paired images. However, the redundancy of cost volume also interferes with the model training and limits the performance. To construct a more precise cost volume, we pioneeringly apply the diffusion model to stereo matching. Our method, termed DiffuVolume, considers the diffusion model as a cost volume filter, which will recurrently remove the redundant information from the cost volume. Two main designs make our method not trivial. Firstly, to make the diffusion model more adaptive to stereo matching, we eschew the traditional manner of directly adding noise into the image but embed the diffusion model into a task-specific module. In this way, we outperform the traditional diffusion stereo matching method by 22% EPE improvement and 240 times inference acceleration. Secondly, DiffuVolume can be easily embedded into any volume-based stereo matching network with boost performance but slight parameters rise (only 2%). By adding the DiffuVolume into well-performed methods, we outperform all the published methods on Scene Flow, KITTI2012, KITTI2015 benchmarks and zero-shot generalization setting. It is worth mentioning that the proposed model ranks 1st on KITTI 2012 leader board, 2nd on KITTI 2015 leader board since 15, July 2023.

研究の動機と目的

  • コストボリューム内の冗長な幾何情報がステレオマッチングの性能と学習効率を低下させることを是正すること。
  • ピクセル単位のノイズ除去が不正確で計算コストが高いため、密度予測タスク(例:ステレオマッチング)において従来の拡散モデルに課せられる制限を克服すること。
  • アーキテクチャを変更せずに、ステレオマッチングネットワークに直接拡散ベースのフィルタリングを統合できる、軽量で即挿し可能なモジュールを設計すること。
  • 合成データで事前学習した後、実世界のデータセットへのゼロショット一般化性能を向上させるために、反復的な情報フィルタリングによりコストボリュームの品質を向上させること。
  • Scene Flow、KITTI、Middlebury、ETH3Dを含む複数のベンチマークで最先端の性能を示し、KITTI2012およびKITTI2015のリーダーボードでトップランクを達成すること。

提案手法

  • 入力としてコストボリュームを処理するタスク固有の拡散プロセスを導入し、ノイズ除去の目的を画像再構成から視差マップの最適化に再定義する。
  • 従来のノイズ予測を、視差マップから導出された学習可能な注意メカニズムに類似したフィルタに置き換え、視差マップを確率ベクトルに離散化することで、より良い情報表現を実現する。
  • U-Netを用いたノイズ予測を必要とせず、軽量なステレオマッチングネットワークで直接視差マップを予測することで、従来の拡散ベース手法と比較して推論速度を240倍高速化する。
  • 既存のコストボリュームベースのステレオマッチングネットワークに、拡散フィルタを即挿し可能なモジュールとして統合し、パラメータはわずか2%増加で性能向上を実現する。
  • 推論速度を向上させるためにDDIMサンプリング戦略を採用し、同時にエッジマップと粗視差マップの条件付けを組み込んで、学習の安定性を向上させる。
  • 理論的分析により、最適化目的関数の変更(ノイズ予測 → 視差マップ予測)が、元の拡散モデルの目的関数と数学的に同等であることが確認され、学習の整合性と安定性が保証される。

実験結果

リサーチクエスチョン

  • RQ1ピクセルレベルのノイズ除去に依存せず、コストボリュームのフィルタリングとして効果的に再利用可能な拡散モデルは、ステレオマッチングにおける冗長な幾何情報の削減に有効に機能するか?
  • RQ2視差マップの離散化に基づくタスク固有の拡散フィルタは、標準的な拡散モデルと比較して、精度と推論速度の両面で優れているか?
  • RQ3合成データで事前学習した後、実世界データセットへの一般化性能が、軽量で即挿し可能な拡散フィルタによってどの程度向上するか?
  • RQ4拡散フィルタの反復的リファインメント処理は、エッジ領域やノンテクスチャ領域といった困難な領域での性能向上に寄与するか?
  • RQ5提案手法は、Scene Flow、KITTI、Middlebury、ETH3Dを含む多様なベンチマークで最先端の結果を達成できるか?

主な発見

  • DiffuVolumeは、ベースラインの拡散ベースステレオマッチング手法(Shao et al., 2022)と比較して、エンドツーエンド誤差(EPE)を22%改善し、顕著な性能向上を示した。
  • ノイズ予測にU-Netを必要とせず、代わりに軽量な視差予測器を用いることで、ベースライン手法と比較して推論速度が240倍高速化された。
  • RAFT-Stereoに統合されたDiffuVolumeはゼロショット一般化性能を向上させ、KITTI2015(フル)で5.56%、ETH3Dで2.50%、Middleburyで15.21%の誤差を達成し、IGEV-Stereoや他のSOTA手法を上回った。
  • KITTI2012では2023年7月15日以降、公式リーダーボードで1位を維持しており、KITTI2015では2位を記録しており、優れた一般化性能とロバストネスを確認した。
  • 可視化結果から、DiffuVolumeはノンテクスチャ領域やエッジ領域におけるアーティファクトを効果的に低減していることが示され、従来の拡散手法が不正確なピクセル生成により視差値のずれを引き起こすのを防いでいる。
  • 理論的分析により、最適化目的関数の変更(ノイズ予測から視差マップ予測へ)が、元の拡散目的関数と数学的に同等であることが確認され、学習の安定性と妥当性が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。