Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating COPY-BLEND Augmentation for Low Level Vision Tasks

Pranjay Shyam, Sandeep Singh Sengar|arXiv (Cornell University)|Mar 10, 2021
Advanced Neural Network Applications参考文献 18被引用数 8
ひとこと要約

本稿では、ノイズあり画像と綺麗な画像のパッチをコピーしてブレンドする、領域ベースのデータ拡張手法であるCopy-Blendを提案する。この手法により、暗所補正、ホコリ除去、ぼかし除去といった低レベルビジョンタスクの性能が向上する。空間的一致性を保ちながら、変動する劣化強度を導入することで、モデル性能の向上、トレーニングデータ要件の低減、バックボーンネットワークを変更せずに早期収束を実現する。

ABSTRACT

Region modification-based data augmentation techniques have shown to improve performance for high level vision tasks (object detection, semantic segmentation, image classification, etc.) by encouraging underlying algorithms to focus on multiple discriminative features. However, as these techniques destroy spatial relationship with neighboring regions, performance can be deteriorated when using them to train algorithms designed for low level vision tasks (low light image enhancement, image dehazing, deblurring, etc.) where textural consistency between recovered and its neighboring regions is important to ensure effective performance. In this paper, we examine the efficacy of a simple copy-blend data augmentation technique that copies patches from noisy images and blends onto a clean image and vice versa to ensure that an underlying algorithm localizes and recovers affected regions resulting in increased perceptual quality of a recovered image. To assess performance improvement, we perform extensive experiments alongside different region modification-based augmentation techniques and report observations such as improved performance, reduced requirement for training dataset, and early convergence across tasks such as low light image enhancement, image dehazing and image deblurring without any modification to baseline algorithm.

研究の動機と目的

  • 標準的な領域変更型データ拡張手法が空間的一致性を損なうため、低レベルビジョンタスクで性能が劣る問題に対処すること。
  • アーキテクチャの変更なしに、コピー・ブレンド拡張戦略が低レベル修復タスクにおけるモデルの汎化性能とロバスト性を向上させることを調査すること。
  • Copy-Blendがペairedトレーニングデータセットのサイズを縮小しつつも最高性能を維持できるかどうかを評価すること。
  • CutMix、CutOut、MixUp、CutBlurなどの既存の拡張手法と比較し、複数の低レベルビジョンベンチマークでCopy-Blendの有効性を検証すること。

提案手法

  • Copy-Blendは、綺麗な画像のパッチをノイズあり入力(および逆)に転送するためのブレンドマスクを構築する。これにより空間的関係が保持され、劣化強度の変動が可能になる。
  • 浮動小数点マスク(α ∈ [0,1])を用いてパッチを滑らかにブレンドし、特徴学習を妨げる鋭いエッジを回避する。
  • ランダムなパッチ形状とサイズを採用し、2つの正方形パッチを1枚の画像に使用した場合に最良の性能が得られた。
  • この拡張は、下位のニューラルネットワークアーキテクチャを変更せずにトレーニング時に適用される。
  • 標準ベンチマーク(LOL、NTIRE-19、GO-PRO、SICE)を用いて、PSNR、SSIM、NIQEの指標で性能を評価する。
  • パッチ数、形状、トレーニングデータの割合に関するアブレーションスタディを実施し、データ効率性と収束速度を評価する。

実験結果

リサーチクエスチョン

  • RQ1標準的な拡張手法と比較して、Copy-Blendは暗所補正、ホコリ除去、ぼかし除去といった低レベルビジョンタスクで性能向上を達成するか?
  • RQ2Copy-Blendは、最高性能を維持しつつ、ペアドトレーニングデータセットのサイズを縮小できるか?
  • RQ3Copy-Blendは、ベースラインおよび他の拡張戦略と比較して、より早期にモデルが収束するか?
  • RQ4拡張されたパッチの数と形状は、モデル性能にどのように影響するか?

主な発見

  • Copy-Blendは、全評価タスクで最高のPSNRとSSIMを達成した:DLNではLOLで21.47/0.86、MSNetではNTIRE-19で14.27/0.62、DeblurGANv2ではGO-PROで29.91/0.93を記録した。
  • ホコリ除去とぼかし除去において、性能向上が顕著で、CutBlurおよび他の領域変更型手法を上回った。
  • 元のトレーニングデータの20%のみを用いても、Copy-Blendを適用したモデルは、ベースライン拡張で全データを使用した場合と同等の最高性能を達成した。
  • Copy-Blendは早期収束を実現し、ベースラインおよび他の拡張手法と比較して、より少ないエポックで最高性能に到達した。
  • 最適な設定は1枚あたり2つの正方形パッチであり、他の形状やパッチ数の増加は性能低下を引き起こした。
  • LOLデータセットにおいて、NIQE(知覚的品質指標)を3.05から2.84に低減し、知覚的品質の向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。