Skip to main content
QUICK REVIEW

[論文レビュー] Deep Fried Convnets

Zichao Yang, Marcin Moczulski|arXiv (Cornell University)|Dec 22, 2014
Advanced Neural Network Applications参考文献 36被引用数 17
ひとこと要約

本稿では、畳み込みニューラルネットワークの全結合層を微分可能に再パrameter化する、適応的Fastfood変換を提案する。パラメータ数をO(nd)からO(n)に、計算量をO(nd)からO(n log d)に削減する。この手法を用いた「デュアルドライヴド・コンボネット」は、MNISTおよびImageNetで最先端の精度を達成し、パラメータ数を最大55%削減した。従来の訓練後低ランク因子分解やプルーニング手法を上回る性能を示した。

ABSTRACT

The fully connected layers of a deep convolutional neural network typically contain over 90% of the network parameters, and consume the majority of the memory required to store the network parameters. Reducing the number of parameters while preserving essentially the same predictive performance is critically important for operating deep neural networks in memory constrained environments such as GPUs or embedded devices. In this paper we show how kernel methods, in particular a single Fastfood layer, can be used to replace all fully connected layers in a deep convolutional neural network. This novel Fastfood layer is also end-to-end trainable in conjunction with convolutional layers, allowing us to combine them into a new architecture, named deep fried convolutional networks, which substantially reduces the memory footprint of convolutional networks trained on MNIST and ImageNet with no drop in predictive performance.

研究の動機と目的

  • 予測性能を損なわずに、深層畳み込みネットワークの全結合層におけるパラメータ数を削減すること。
  • パラメータ削減を微分可能にすることで、圧縮ネットワークのエンドツーエンド訓練を可能にすること。
  • 計算コストは小さいが、パラメータ数が支配的である大規模な全結合層の非効率性を是正すること。
  • ImageNetのような大規模な視覚タスクに、構造的ランダムプロジェクションを効果的に適応できるかを検証すること。
  • 深層学習環境における、適応的と非適応的ランダムプロジェクションの性能を比較すること。

提案手法

  • 全結合層における行列-ベクトル乗算の微分可能再パラメータ化として、適応的Fastfood変換を提案する。
  • Fastfood変換を一般化し、適応的重みを許容することでエンドツーエンド訓練を可能にする。
  • 学習可能なパラメータを有する構造的ランダムプロジェクションを用いて、密行列を近似する。
  • 標準的な畳み込みアーキテクチャの全結合層にこの変換を適用し、「デュアルドライヴド・コンボネット」を構築する。
  • ストレージをO(nd)からO(n)、計算量をO(nd)からO(n log d)に削減するパラメータ共有方式を採用する。
  • 変換をネットワークの訓練パイプラインに統合し、畳み込み部と全結合部の共同最適化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1微分可能で構造的なランダムプロジェクション手法が、モデル精度を損なわず全結合層のパラメータ数を削減できるか。
  • RQ2ImageNetのような大規模データセットにおいて、適応的Fastfoodの性能は非適応的ランダムプロジェクションと比べてどうか。
  • RQ3適応的Fastfood変換を用いたエンドツーエンド訓練は、訓練後低ランク因子分解やプルーニングに比べて優れた結果をもたらすか。
  • RQ4出力のソフトマックス層をどの程度圧縮できるか、精度損失が顕著に現れない範囲はどの程度か。
  • RQ5提案手法が、リソース制約のある環境における大規模モデルの効率的訓練とデプロイメントを可能にするか。

主な発見

  • 適応的Fastfood変換を用いたデュアルドライヴド・コンボネットは、ImageNetで32.8Mパラメータ(58.7Mパラメータの参照モデルと比較)にまで55%のパラメータ削減を達成し、トップ1誤差は0.14%増加にとどまった。
  • 訓練後SVD因子分解より優れた性能を示した:SVD-half-Fはパラメータを46.6Mに削減したが、誤差は42.73%に増加した。一方、適応的Fastfood 32はより少ないパラメータで41.93%の誤差を達成した。
  • 適応的Fastfood 32モデルの最終ソフトマックス層にSVDを適用することで、さらに1250万パラメータ(20.3Mに)削減でき、誤差は約0.7%増加した。
  • 適応的Fastfood 16は、1640万パラメータ(28%削減)でトップ1誤差42.90%を達成し、高い効率-精度トレードオフを示した。
  • ImageNet上での非適応的Fastfoodに比べ、適応的バージョンが顕著に優れた性能を示し、大規模な視覚タスクにおいて投影パラメータの学習が不可欠であることを示した。
  • 従来のプルーニングやSVDのような後処理手法とは異なり、本手法は訓練時段階で顕著なパラメータ削減を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。