Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Attacks on Monocular Depth Estimation

Ziqi Zhang, Xinge Zhu|arXiv (Cornell University)|Mar 23, 2020
Adversarial Robustness in Machine Learning参考文献 62被引用数 14
ひとこと要約

本稿は、単眼深度推定における敵対的攻撃の最初の体系的調査を提示し、非標的、標的、およびユニバーサル攻撃のシナリオを導入している。最先端の攻撃手法を適応させるとともに、深度とセグメンテーションの両方の監視を活用するマルチタスク攻撃戦略を提案することで、著者らは特定の物体に対して、敵対的摂動が深度予測を最大4倍(例:20mから80mへ)歪ませることを実証した。これは、自動運転などの安全に直結する応用で使用される深度推定モデルに深刻な脆弱性が存在することを示している。

ABSTRACT

Recent advances of deep learning have brought exceptional performance on many computer vision tasks such as semantic segmentation and depth estimation. However, the vulnerability of deep neural networks towards adversarial examples have caused grave concerns for real-world deployment. In this paper, we present to the best of our knowledge the first systematic study of adversarial attacks on monocular depth estimation, an important task of 3D scene understanding in scenarios such as autonomous driving and robot navigation. In order to understand the impact of adversarial attacks on depth estimation, we first define a taxonomy of different attack scenarios for depth estimation, including non-targeted attacks, targeted attacks and universal attacks. We then adapt several state-of-the-art attack methods for classification on the field of depth estimation. Besides, multi-task attacks are introduced to further improve the attack performance for universal attacks. Experimental results show that it is possible to generate significant errors on depth estimation. In particular, we demonstrate that our methods can conduct targeted attacks on given objects (such as a car), resulting in depth estimation 3-4x away from the ground truth (e.g., from 20m to 80m).

研究の動機と目的

  • 自動運転などの安全に直結する応用における単眼深度推定モデルの敵対的攻撃に対する脆弱性を調査すること。
  • 深度推定に特化した攻撃シナリオの分類法—非標的、標的、ユニバーサル攻撃—を定義し、ベンチマークすること。
  • 分類およびセグメンテーションから得られる既存の敵対的攻撃手法を、回帰ベースの深度推定タスクに適応すること。
  • 深度推定とセマンティックセグメンテーションの両方を同時に最適化することで、ユニバーサル攻撃の性能を向上させる、新しいマルチタスク攻撃戦略を提案すること。
  • KITTIデータセット上で、異なるバックボーンアーキテクチャ(例:ResNet-50、VGG-16)が敵対的摂動に対してどのように耐性を示すかを評価すること。

提案手法

  • 著者らは、3つの攻撃シナリオを定義している:非標的(深度を全体的に歪める)、標的(特定の物体の深度を誤って推定する)、ユニバーサル(複数の画像に同一の摂動を適用する)。
  • 攻撃を分類タスクから深度推定タスクに適応させるために、FGSM、I-FGSM、MI-FGSMという3つの最先端の敵対的攻撃手法を、深度予測損失関数の勾配に基づく最適化問題として定式化している。
  • マルチタスク攻撃戦略が導入されており、ユニバーサル摂動は、深度推定とセマンティックセグメンテーションの両方の監視を含む組み合わせ損失関数によって最適化されている(重み w_depth = 0.5、w_semantic = 0.5)。
  • 白箱設定でKITTIデータセットを用い、深度推定およびセグメンテーションタスクに微調整済みのモデルを用いて攻撃を実行している。
  • ユニバーサル敵対的摂動は、複数の画像全体で深度推定誤差を最大化するように、1つの摂動ベクトルを最適化することで生成されている。
  • 本手法ではマルチタスク損失関数が使用されており、L_total = w_depth × L_depth + w_semantic × L_semantic と定式化されている。ここで、L_depth は予測深度と真値深度のRMSEであり、L_semantic はセグメンテーションの交差エントロピー損失である。

実験結果

リサーチクエスチョン

  • RQ1敵対的攻撃は単眼深度推定の予測を効果的に歪ませることができるか。その歪みの程度はどの程度か?
  • RQ2非標的、標的、ユニバーサル攻撃といった異なる攻撃タイプは、深度推定性能にどのように影響を与えるか?
  • RQ3セマンティックセグメンテーションからの監視信号を組み合わせることで、ユニバーサル敵対的攻撃の効果が向上するか?
  • RQ4モデルアーキテクチャ(例:ResNet-50 対 VGG-16)は、深度推定における敵対的攻撃に対してどのように脆弱性に影響を与えるか?
  • RQ5敵対的摂動は、車や歩行者といった特定の物体の深度を、極端な値へとどれだけ制御的に操作できるか?

主な発見

  • 標的攻撃は、特定の物体の深度推定値を最大4倍まで歪ませることができ、真値から20mから80mへとずらすことが可能である。
  • 平均的な深度推定誤差(RMSE)は、クリーンな入力と比較して最大10倍まで増加し、モデルの深刻な脆弱性を示している。
  • テストされたバックボーンの中ではResNet-50が最も脆弱であり、性能が優れたモデルほど敵対的攻撃に対して感受性が高いという観察と整合的である。
  • マルチタスク攻撃戦略は、ユニバーサル攻撃の性能を顕著に向上させ、MI-FGSMではResNet-50で単一タスク設定の7.257からRMSEが9.757に向上した。
  • ユニバーサル摂動は非常に効果的かつ隠蔽性が高く、視覚的外観を保ちつつ他の画像領域の変化を最小限に抑えながら、大きな深度歪みを引き起こしている。図2の杭の詳細部の保存状態がそれを示している。
  • 攻撃は、ターゲットオブジェクトの深度を任意の値へと操作可能であり、例として11.4mから80.8mまでにまで拡大させることで、深度推定の完全な制御性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。