Skip to main content
QUICK REVIEW

[論文レビュー] DeepCorrect: Correcting DNN models against Image Distortions

Tejas Borkar, Lina J. Karam|arXiv (Cornell University)|May 5, 2017
Advanced Image Processing Techniques被引用数 11
ひとこと要約

DeepCorrectは、ぼかしやノイズなどの画像歪みに対して深層ニューラルネットワーク(DNN)の頑健性を向上させる手法を提案する。歪みに特に感受性が高い畳み込みフィルタを特定し、それらに軽量な残差補正ユニットを付加することで、微調整よりも優れた性能を達成する。訓練可能なパラメータが著しく少なく、推論コストも最小限に抑えられる。

ABSTRACT

In recent years, the widespread use of deep neural networks (DNNs) has facilitated great improvements in performance for computer vision tasks like image classification and object recognition. In most realistic computer vision applications, an input image undergoes some form of image distortion such as blur and additive noise during image acquisition or transmission. Deep networks trained on pristine images perform poorly when tested on such distortions. In this paper, we evaluate the effect of image distortions like Gaussian blur and additive noise on the activations of pre-trained convolutional filters. We propose a metric to identify the most noise susceptible convolutional filters and rank them in order of the highest gain in classification accuracy upon correction. In our proposed approach called DeepCorrect, we apply small stacks of convolutional layers with residual connections, at the output of these ranked filters and train them to correct the worst distortion affected filter activations, whilst leaving the rest of the pre-trained filter outputs in the network unchanged. Performance results show that applying DeepCorrect models for common vision tasks like image classification (ImageNet), object recognition (Caltech-101, Caltech-256) and scene classification (SUN-397), significantly improves the robustness of DNNs against distorted images and outperforms other alternative approaches..

研究の動機と目的

  • 事前学習済みDNNのすべての畳み込みフィルタが、ガウスノイズや白色ガウスノイズ(AWGN)などの画像歪みに対して同等に感受性を示すかどうかを調査すること。
  • 個々の畳み込みフィルタの入力歪みに対する感受性を定量化・順位付けするための指標を開発すること。
  • ネットワーク全体の再学習を伴わずに、最も歪みに影響を受けやすいフィルタの出力を補正するための軽量で学習可能な補正ユニットを設計すること。
  • クリーンな画像における高い性能を維持しつつ、特に重度の歪みに対して顕著な頑健性の向上を達成すること。
  • 分離可能な畳み込みを用いたランク制約近似により、補正ユニットの計算コストを低減し、ほぼリアルタイムの推論を可能にすること。

提案手法

  • 事前学習済みDNNのフィルタ出力にガウスノイズとAWGNが与える影響を評価し、歪みに感受性の高いフィルタを同定する。
  • 歪み下での活性化分散と分類精度の低下に基づく感受性指標を提案し、フィルタの脆弱性を順位付けに用いる。
  • 残差接続を備えた畳み込み層の小さなスタックとして補正ユニットを設計し、上位ランクのフィルタの歪み出力を回復するように学習する。
  • 最も感受性の高いフィルタにのみ補正ユニットを接続し、残りの事前学習済みネットワーク重みは凍結して元の特徴を保持する。
  • 深さ方向分離畳み込み(例:3×1および1×3カーネル)を用いたランク制約近似を適用し、FLOPsを削減して推論効率を維持する。
  • 歪み入力での分類誤差を最小化するように補正ユニットを学習するが、同時にクリーン画像の精度を損なわないようにするターゲット指向損失関数を用いる。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みDNNのすべての畳み込みフィルタが、ぼかしやノイズといった画像歪みに対して同等に感受性を示すのか?
  • RQ2定量的指標を用いて、個々のフィルタの入力歪みに対する感受性を正確に測定・順位付けできるか?
  • RQ3ネットワーク全体の再学習を伴わずに、最も歪みに感受性の高いフィルタ出力の補正が、顕著な性能向上をもたらすのか?
  • RQ4ランク制約付き畳み込みを用いた軽量補正ユニットは、頑健性の向上を実現しつつ、高い推論効率を維持できるか?
  • RQ5本手法は微調整および安定性学習と比較して、精度、パラメータ効率、推論コストの観点でどのように優れているか?

主な発見

  • ImageNet上での評価において、DeepCorrectはガウスぼかしで3.2%、AWGNで1.47%、モーションぼかしで4.86%、デフォーカスぼかしで6.95%、カメラシェイクぼかしで5%の性能向上を達成した。
  • パラメータ数を微調整の50%に抑えたDeepcorr-bバージョンは、ガウスぼかしで3.95%、カメラシェイクぼかしで5.36%の性能向上を達成した。
  • ランク制約付きのDeepcorr-rcモデルは、微調整および安定性学習を上回る性能を発揮しながら、FLOPsは5.1×10⁷に抑えられ、ベースラインのResNet18と同等の水準であった。
  • Deepcorr-rcは元のResNet18とほぼ同等の推論コストを維持しており、全ネットワークを低ランク層に置き換えた場合と比較してFLOPsが30%削減された。
  • 歪みに影響を受けるフィルタに特化した補正ユニットは、クリーン画像での性能を著しく損なわず、頑健性を顕著に向上させた。
  • 本手法は分類を超えて、オブジェクト検出やセマンティックセグメンテーションへの応用可能性を示し、敵対的ノイズを含む他のノイズタイプに対しても適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。