[論文レビュー] Self-Supervised Monocular Depth Estimation with Self-Reference Distillation and Disparity Offset Refinement
本論文は、自己参照 distillation と視差オフセットの最適化を用いた自己教師付き単眼深度推定手法を提案する。継続的に更新される生徒・教師モデルペアと、マルチビュー整合性を用いた外れ値のフィルタリングにより、深度推定の精度を向上させ、アップサンプリングに起因するずれを軽減し、KITTI および Make3D ベンチマークで最先端の性能を達成する。
Monocular depth estimation plays a fundamental role in computer vision. Due to the costly acquisition of depth ground truth, self-supervised methods that leverage adjacent frames to establish a supervisory signal have emerged as the most promising paradigms. In this work, we propose two novel ideas to improve self-supervised monocular depth estimation: 1) self-reference distillation and 2) disparity offset refinement. Specifically, we use a parameter-optimized model as the teacher updated as the training epochs to provide additional supervision during the training process. The teacher model has the same structure as the student model, with weights inherited from the historical student model. In addition, a multiview check is introduced to filter out the outliers produced by the teacher model. Furthermore, we leverage the contextual consistency between high-scale and low-scale features to obtain multiscale disparity offsets, which are used to refine the disparity output incrementally by aligning disparity information at different scales. The experimental results on the KITTI and Make3D datasets show that our method outperforms previous state-of-the-art competitors.
研究の動機と目的
- 現実世界の深度アノテーションの限られた可用性に起因する課題に対処するため、自己教師付き単眼深度推定を進歩させる。
- 標準的な自己教師付き手法が失敗する動的領域や低テクスチャ領域における訓練の安定性と深度推定精度を向上させる。
- マルチスケール特徴抽出におけるアップサンプリングに起因する視差のずれを解消するため、文脈的一致性に基づく最適化を導入する。
- 従来の distillation 法の二段階訓練のオーバーヘッドを回避する単一段階で効率的な distillation フレームワークを開発する。
提案手法
- 同じアーキテクチャを持つ教師モデルを、各訓練エポックで生徒の重みによって更新することで、進化する指導を提供する自己参照 distillation を導入する。
- 前向きおよび後向きの画像ワープの整合性を検証することで、動きやエッジ領域における信頼性の低い深度予測を検出し、抑制するマルチビュー・チェック・フィルタを適用する。
- 高レベルと低レベルの特徴間の文脈的一致性を活用し、マルチスケールの視差オフセットを予測することで、視差マップを段階的に最適化する。
- 視差オフセットフィールドを用いて、アップサンプリング中に生じるずれを補正し、特徴スケール間の整合性を向上させる。
- 写真再構成損失と、フィルタリングされた教師出力からの distillation 損失を組み合わせた、エンドツーエンドの生徒モデル訓練を行う。
- マルチビュー・チェックから導出されるバイナリ化されたハードマスクを用い、distillation 中に高誤差領域を効果的に抑制することで、耐性を向上させる。

実験結果
リサーチクエスチョン
- RQ1継続的に更新される教師モデルは、別個の事前学習を必要とせずに自己教師付き深度推定を向上させることができるか?
- RQ2distillation 中に、教師モデルからの信頼性の低い深度予測をフィルタリングするためのマルチビュー整合性チェックは、どの程度効果的か?
- RQ3特徴レベルの文脈に基づく視差オフセット最適化は、マルチスケール視差予測におけるずれを低減できるか?
- RQ4提案手法は、従来の二段階 distillation 手法と比較して、より優れた性能と効率を達成できるか?
主な発見
- 提案手法は、KITTI および Make3D データセットで最先端の性能を達成し、以前の自己教師付き手法を上回る。
- 自己参照 distillation モジュールは、Sq Rel メトリックを顕著に改善し、深度推定誤差の低減効果を示している。
- マルチビュー・チェック・フィルタから得られるハードマスクは、すべての評価指標でソフトマスク、発見マスク、自動マスクを上回り、特に外れ値の処理において優れた性能を示した。
- MPViT-S をバックボーンとして使用した場合が最も優れた性能を示し、提案モジュールによる強力な特徴表現学習の有効性を示している。
- 計算コストの増加を最小限に抑えながら優れた結果を達成しており、二段階 distillation 手法と比較して、トレーニング時間と FLOPs の両面で優位性を示した。
- アブレーションスタディにより、自己参照 distillation、マルチビュー・チェック、視差整合性の各モジュールが、性能向上に独立してかつ顕著に寄与していることが確認された。
![Figure 2: Overview of the proposed framework. The model adopts an encoder-decoder architecture, in which the encoder is a commonly used backbone, such as ResNet [ 13 ] and Swin Transformer [ 14 ] . Our decoder outputs disparity, which is then converted to depth. The branch of the teacher model provi](https://ar5iv.labs.arxiv.org/html/2302.09789/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。