[論文レビュー] Adversarial Training of Self-supervised Monocular Depth Estimation against Physical-World Attacks
本論文は、自己教師ありモノクローラル深度推定(MDE)のための自己教師あり敵対的訓練手法を提案し、真の深度ラベルが不要な状態で物理的攻撃に対して高い耐性を示す。ステレオ画像からのビュー合成を活用し、訓練中に$L_0$-ノルムバウンデッド摂動を適用することで、デジタルおよび物理的敵対的攻撃の両方に対して強力な防御を達成しつつ、クリーンな精度の低下を最小限に抑える。
Monocular Depth Estimation (MDE) is a critical component in applications such as autonomous driving. There are various attacks against MDE networks. These attacks, especially the physical ones, pose a great threat to the security of such systems. Traditional adversarial training method requires ground-truth labels hence cannot be directly applied to self-supervised MDE that does not have ground-truth depth. Some self-supervised model hardening techniques (e.g., contrastive learning) ignore the domain knowledge of MDE and can hardly achieve optimal performance. In this work, we propose a novel adversarial training method for self-supervised MDE models based on view synthesis without using ground-truth depth. We improve adversarial robustness against physical-world attacks using L0-norm-bounded perturbation in training. We compare our method with supervised learning based and contrastive learning based methods that are tailored for MDE. Results on two representative MDE networks show that we achieve better robustness against various adversarial attacks with nearly no benign performance degradation.
研究の動機と目的
- 自己教師ありモノクローラル深度推定(MDE)における物理的攻撃に対する耐性のない防御手法の欠如に対処すること。
- 自己教師ありMDEでは入手不可能な真の深度ラベルを必要とする従来の敵対的訓練の制限を克服すること。
- 自然な入力に対する性能を低下させることなく耐性を向上させること。
- ステレオビューからの幾何的制約を活用して、現実的な敵対的摂動をシミュレートする手法を開発すること。
- 多様な条件下でデジタル世界および現実の物理的攻撃に対して有効性を検証すること。
提案手法
- 印刷された2次元ボード(例:車)のステレオビューを2台のカメラまたは動画フレームで撮影し、合成された訓練データを生成する。
- 1つのビューにおけるボードの2次元画像に$L_0$-ノルムバウンデッド摂動を適用し、敵対的攻撃をシミュレートする。
- 推定された深度とカメラポーズパラメータを用いて、2番目のビューから摂動を加えた画像を再構築するためのビュー合成を実行する。
- 再構築画像と摂動を加えた画像を教師信号として用い、自己教師あり敵対的訓練が可能なMDEモデルを訓練する。
- ビュー間の幾何的整合性を微分可能損失として統合し、深度推定の耐性を向上させる。
- 一般化と攻撃効果性のバランスを取るために、訓練中に物体距離をランダムにサンプリング(5–10 m)する。
実験結果
リサーチクエスチョン
- RQ1真の深度ラベルなしで、自己教師あり敵対的訓練をモノクローラル深度推定に効果的に適用できるか?
- RQ2ビュー合成フレームワーク内での$L_0$-ノルムバウンデッド摂動は、物理的攻撃に対してどのように耐性を向上させるか?
- RQ3提案手法は、敵対的例に対する防御を実施しながらも、クリーンな入力における高い性能を維持できるか?
- RQ4耐性と転送性の観点から、教師ありおよびコントラスト学習ベースの防御手法と比較して、本手法はどのように差をつけるか?
- RQ5耐性と一般化のバランスを取るために、最適な物体距離範囲は何か?
主な発見
- 提案手法L0+SelfSupは、教師ありおよびコントラスト学習ベースのベースラインと比較して、デジタル世界および物理的攻撃の両方に対して優れた耐性を示す。
- 本手法は、悪意のない性能にほとんど低下を示さず、元のモデルのクリーン入力における正確性を保持している。
- L0+SelfSupモデルから生成された敵対的例は、転送性が低く、ブラックボックス攻撃に対しても強力な防御を示している。
- 5–10メートルの距離範囲で訓練したモデルが最良の耐性を示し、範囲が狭いか広いかの両方の条件を上回っている。
- 物理的攻撃評価では、移動中の車両に敵対的パッチが貼られた場合に、深さ推定の誤差(例:「穴」)を効果的に軽減した。
- さまざまな照明条件、道路タイプ、走行状況下でも、最先端の物理的攻撃に対して効果的に防御できる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。