Skip to main content
QUICK REVIEW

[論文レビュー] Learning in the Frequency Domain

Kai Xu, Minghai Qin|arXiv (Cornell University)|Feb 27, 2020
Advanced Neural Network Applications参考文献 2被引用数 14
ひとこと要約

本稿では、ディスクリートコサイン変換(DCT)係数を深層ニューラルネットワークの入力として用いることで周波数ドメインでの学習を提案する。空間的ダウンサンプリングを回避することで、従来の空間的リサイズに比べて高い精度を達成し、顕著な周波数成分の静的チャネル選択により入力サイズと通信帯域を削減する。ImageNetにおけるResNet-50では、+1.60%のトップ1精度向上を達成する。

ABSTRACT

Deep neural networks have achieved remarkable success in computer vision tasks. Existing neural networks mainly operate in the spatial domain with fixed input sizes. For practical applications, images are usually large and have to be downsampled to the predetermined input size of neural networks. Even though the downsampling operations reduce computation and the required communication bandwidth, it removes both redundant and salient information obliviously, which results in accuracy degradation. Inspired by digital signal processing theories, we analyze the spectral bias from the frequency perspective and propose a learning-based frequency selection method to identify the trivial frequency components which can be removed without accuracy loss. The proposed method of learning in the frequency domain leverages identical structures of the well-known neural networks, such as ResNet-50, MobileNetV2, and Mask R-CNN, while accepting the frequency-domain information as the input. Experiment results show that learning in the frequency domain with static channel selection can achieve higher accuracy than the conventional spatial downsampling approach and meanwhile further reduce the input data size. Specifically for ImageNet classification with the same input size, the proposed method achieves 1.41% and 0.66% top-1 accuracy improvements on ResNet-50 and MobileNetV2, respectively. Even with half input size, the proposed method still improves the top-1 accuracy on ResNet-50 by 1%. In addition, we observe a 0.8% average precision improvement on Mask R-CNN for instance segmentation on the COCO dataset.

研究の動機と目的

  • 深層学習における高解像度画像の空間的ダウンサンプリングによる精度低下を是正すること。
  • AI推論システムにおける高いチップ間通信帯域のボトルネックを克服すること。
  • CNNのスペクトルバイアスと人間視覚系の特徴を活用し、除去可能な非本質的周波数成分を特定すること。
  • 既存のCNNモデルにおける空間的前処理を置き換える普遍的で最小限の変更を伴う手法を開発すること。
  • 周波数ドメインでの学習と静的チャネルプルーニングにより、入力サイズを削減しながら高い精度を達成すること。

提案手法

  • 高解像度RGB画像をディスクリートコサイン変換(DCT)を用いて周波数ドメイン表現に変換する。
  • 標準的なCNNアーキテクチャ(例:ResNet-50、MobileNetV2、Mask R-CNN)に最小限のアーキテクチャ変更でDCT係数を直接入力する。
  • 各周波数チャネルごとに「オンオフスイッチ」を用いた学習ベースの動的チャネル選択機構を実装し、無関係な成分を特定・除去する。
  • スペクトルバイアス解析に基づき、静的チャネル選択を適用し、最大87.5%の周波数チャネルを除去しても精度に影響がない。
  • 高忠実度の復元画像を訓練および推論に使用することで、モデル性能を維持しながら入力サイズを削減する。
  • CPUとアクセラレータ間の入力データサイズと通信帯域を削減することで、推論最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1空間的リサイズに比べ、画像の周波数ドメイン表現が深層学習の精度を向上させ得るか?
  • RQ2非本質的周波数成分をどれだけ除去してもモデル性能が劣化しないか?
  • RQ3CNNのスペクトルバイアスと人間視覚系の周波数帯域感受性の違いは何か?
  • RQ4既存のCNNパイプラインにおける空間的前処理を置き換える普遍的で最小限の変更を伴う手法を開発可能か?
  • RQ5周波数ドメインプルーニングにより、精度を維持したまま最大どれほど入力サイズを削減できるか?

主な発見

  • 本手法は、同じ入力サイズでImageNetにおけるResNet-50のトップ1精度を従来の空間的リサイズに比べ+1.60%向上する。
  • MobileNetV2では、同一の入力条件下でトップ1精度が+0.63%向上する。
  • 入力サイズを半分にした場合でも、ResNet-50のトップ1精度がImageNetで+1.42%向上する。
  • COCOデータセットにおいて、Mask R-CNNを用いた物体検出およびインスタンスセグメンテーションの平均精度が+0.8%向上する。
  • 静的チャネル選択手法により、ImageNetで最大87.5%の周波数チャネルを除去しても、精度に顕著な低下がない。
  • 周波数ドメインアプローチにより、入力データサイズとチップ間通信帯域が削減され、AI推論システムにおける主要なボトルネックが軽減される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。