Skip to main content
QUICK REVIEW

[論文レビュー] Delving Deeper into Anti-aliasing in ConvNets

Xueyan Zou, Fanyi Xiao|arXiv (Cornell University)|Aug 21, 2020
Digital Media Forensic DetectionComputer Science参考文献 32被引用数 21
ひとこと要約

この論文では、ダウンサンプリング中のアリゼーションを抑えるために、空間的およびチャネルワイズに変化するフィルタ重みを予測するコンテンツに適応した、アダプティブなローパスフィルタリング層をConvNetsに提案する。局所的でチャネル固有のぼかしを学習することで、ImageNet、COCO、Cityscapesのベンチマークにおいて、計算コストの増加が最小限であるにもかかわらず、固定フィルタベースラインを上回る精度とシフト整合性の向上を実現する。

ABSTRACT

Aliasing refers to the phenomenon that high frequency signals degenerate into completely different ones after sampling. It arises as a problem in the context of deep learning as downsampling layers are widely adopted in deep architectures to reduce parameters and computation. The standard solution is to apply a low-pass filter (e.g., Gaussian blur) before downsampling. However, it can be suboptimal to apply the same filter across the entire content, as the frequency of feature maps can vary across both spatial locations and feature channels. To tackle this, we propose an adaptive content-aware low-pass filtering layer, which predicts separate filter weights for each spatial location and channel group of the input feature maps. We investigate the effectiveness and generalization of the proposed method across multiple tasks including ImageNet classification, COCO instance segmentation, and Cityscapes semantic segmentation. Qualitative and quantitative results demonstrate that our approach effectively adapts to the different feature frequencies to avoid aliasing while preserving useful information for recognition. Code is available at https://maureenzou.github.io/ddac/.

研究の動機と目的

  • ダウンサンプリングに起因するアリゼーションを是正することにより、シフト不変性の低下と性能劣化を是正すること。
  • すべての領域とチャネルを均一にぼかす固定ローパスフィルタ(例:ガウスノイズ)の限界を克服し、情報損失を低減すること。
  • 局所的なコンテンツ周波数とチャネル固有の特徴パターンに応じてぼかし強度を最適化するアダプティブなフィルタリング機構を開発すること。
  • セグメンテーションタスクにおけるシフト整合性を評価する新しい評価指標を導入することで、入力シフトに対するロバストネスを向上させること。
  • 画像分類、セマンティックセグメンテーション、インスタンスセグメンテーション、ドメイン一般化の各タスクにわたる一般化性能を示すこと。

提案手法

  • 入力特徴マップからフィルタ係数を予測する軽量なMLPヘッドを用い、空間的位置およびチャネルグループごとにフィルタ重みを予測する学習可能なアダプティブなローパスフィルタリング層を導入する。
  • 空間的およびチャネルワイズに適応可能なフィルタリングを実現するため、特徴チャネルをグループ化し、各グループごとにフィルタを予測する。
  • 予測されたフィルタを、空間的位置とチャネルごとに変化する学習可能なカーネルを持つ動的2次元畳み込みとして適用する。
  • 標準的なConvNetアーキテクチャに変更を加えずに、シームレスに統合可能な微分可能フィルタリング演算を採用する。
  • 空間的およびチャネルワイズの両方の適応性を実現するため、特徴チャネルをグループ化し、各グループに対してフィルタを予測する。
  • バックプロパゲーションによるエンドツーエンド学習を可能にするために、フィルタリングプロセスの微分可能近似を用いる。

実験結果

リサーチクエスチョン

  • RQ1固定ローパスフィルタと比較して、アダプティブでコンテンツに適応したフィルタリングは、ConvNetsにおけるアリゼーションをより効果的に低減できるか?
  • RQ2空間的およびチャネルワイズに適応するフィルタリングは、セマンティックセグメンテーションおよびインスタンスセグメンテーションにおけるシフト整合性にどのように影響するか?
  • RQ3提案手法は、モデル容量の増加なしに、画像分類およびセグメンテーションベンチマークで性能を向上させることができるか?
  • RQ4アダプティブフィルタリングは、エッジなどの高周波成分をどれほど保持しながらノイズを抑制できるか?
  • RQ5チャネルグループ数の増加が、アダプティブフィルタリング機構における性能と一般化能力に与える影響はどの程度か?

主な発見

  • ResNet-18を用いたImageNetでは、68.0%のトップ1精度を達成し、ResNet(66.5%)およびガウスノイズベースライン(66.7%)を上回る。
  • シフト整合性が80.9%に向上し、ResNet(79.1%)およびガウスノイズ(79.8%)を大きく上回り、入力シフトに対して高いロバストネスを示した。
  • チャネルグループ数の増加に伴い、8グループで飽和点に達するまで精度が向上し、それ以上は利得が小さくなることが示された。
  • ネットワーク容量の増加よりも優れた性能向上を達成し、ResNet-101ではパrameterがわずかに4.5%増加したのみで0.3%の精度向上を達成した。
  • 定性的な結果では、Cityscapesのセマンティックセグメンテーションにおいて、ベースラインと比較して道路やポールの輪郭が明瞭に保たれている。
  • 可視化結果から、モデルが輪郭に沿って強いぼかしを適用することでエッジを拡大し、ダウンサンプリング後の構造的詳細を保持していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。