Skip to main content
QUICK REVIEW

[論文レビュー] 3D Common Corruptions and Data Augmentation

Oğuzhan Fatih Kar, Teresa Yeo|arXiv (Cornell University)|Mar 2, 2022
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本稿では、動きのパララックスを伴う運動歪み、被写界深度を伴うボケの歪み、3次元シーン構造に基づく隠蔽を模倣する、幾何学的感度を持つ画像歪みである3D共通歪み(3DCC)を導入する。この手法はデータ拡張として用いられ、2Dのみの拡張と比較して3DCCおよびAEベンチマークで最大20%の誤差低減を実現し、モデルの頑健性を向上させる。

ABSTRACT

We introduce a set of image transformations that can be used as corruptions to evaluate the robustness of models as well as data augmentation mechanisms for training neural networks. The primary distinction of the proposed transformations is that, unlike existing approaches such as Common Corruptions, the geometry of the scene is incorporated in the transformations -- thus leading to corruptions that are more likely to occur in the real world. We also introduce a set of semantic corruptions (e.g. natural object occlusions). We show these transformations are `efficient' (can be computed on-the-fly), `extendable' (can be applied on most image datasets), expose vulnerability of existing models, and can effectively make models more robust when employed as `3D data augmentation' mechanisms. The evaluations on several tasks and datasets suggest incorporating 3D information into benchmarking and training opens up a promising direction for robustness research.

研究の動機と目的

  • 3次元シーンにおける実世界の分布シフトを反映する、現実的で幾何学的感度を持つ画像歪みのベンチマークを開発すること。
  • Common Corruptionsのような2Dのみの歪みの限界、すなわちシーンの深度を無視し、不自然な歪みを生じることを是正すること。
  • 3次元シーン幾何を統合した効率的で即時の3次元データ拡張技術を設計し、モデルの頑健性を向上させること。
  • 3DCCが既存モデルの脆弱性を露呈し、トレーニング時に使用することで頑健性が向上することを示すこと。
  • 3次元アノテーションを必要とせず、標準的なビジョンデータセットに適用可能なスケーラブルで拡張可能なフレームワークを提供すること。

提案手法

  • 単眼深度推定から得られる3次元シーン幾何を用いて歪みを生成し、動きのパララックスや被写界深度のぼやけなど現実的な効果を実現する。
  • 3次元シーン再構築を用いて、深度依存のファネル、影付きの照明、視点依存の隠蔽といったシーン認識変換を適用する。
  • 20種類の異なる3次元歪み(被写界深度ぼやけ、運動ぼやけ、照明変化、セマンティック隠蔽など)を即時計算で生成する。
  • 微分可能レンダリングと3次元認識ワープを用いて、シーン幾何と整合性を保ちながら歪みを適用する。
  • 二重トレーニング戦略を採用:3DCC上でモデルの頑健性を評価し、3D拡張を用いて幾何的歪みへの不変性を学習する。
  • 推定された深度マップを活用することで、ImageNet や Taskonomy などの標準データセットへの応用を可能にし、3次元ラベルが不要な広範な適用性を実現する。

実験結果

リサーチクエスチョン

  • RQ13D認識歪みは、従来の2D歪みと比べて現実性や失敗モードの露呈においてどのように異なるか?
  • RQ2既存の頑健性手法は、2D歪みと比較して3D共通歪み(3DCC)の下でどの程度失敗するのか?
  • RQ33D認識データ拡張は、実世界の分布シフトに対してモデルの頑健性を顕著に向上させることができるか?
  • RQ42Dのみの拡張と比較して、3DCCベースの拡張はクリーンデータおよび歪みありデータの性能向上にどの程度寄与するか?
  • RQ53DCCは、幾何的に妥当な歪みを想定した一般化性能の評価に信頼できるベンチマークとして機能できるか?

主な発見

  • 2Dデータ拡張で訓練されたモデルに対して3DCCベンチマークは顕著な頑健性の欠陥を露呈し、2DCCと比較して3DCCで最大20%の性能低下を示した。
  • 3Dデータ拡張で訓練されたモデル(Ours)は、2DCCで5.32 ℓ₁誤差、3DCCで5.42 ℓ₁誤差を達成し、O+DPT+2DCC(5.78および5.94)およびO+DPT(6.43および6.13)を上回った。
  • AEベンチマーク(合成された実世界の歪み)では、提案手法が4.94 ℓ₁誤差を達成し、O+DPT+2DCC(6.50)と比較して23.9%の改善を示した。
  • OASISデータセットでは、提案手法が23.89の角度誤差を達成し、次善のベースライン(24.65)と比較して4.9%の改善を示した。これは、実世界の屋外データにおいても頑健性を示している。
  • Ours+X-TCモデルは、2DCCで5.29、3DCCで5.35の誤差にまで低減し、3D拡張とクロスタスク一貫性を組み合わせることで一般化性能が向上することを示した。
  • 定性的な結果から、3D拡張で訓練されたモデルの予測は、DSLR画像やYouTube動画を含む多様な実世界シナリオにおいて顕著に頑健であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。