[論文レビュー] Compression of Fully-Connected Layer in Neural Network by Kronecker Product
本稿では、重み行列を小さな行列のクリプトーネル積の線形結合として近似することで、ニューラルネットワークの全結合層を圧縮するKronecker全結合(KFC)層を提案する。パラメータを最大99%まで削減し、計算時間も顕著に短縮できる一方で、妥当な精度を維持する。SVHNでは73%のパラメータ削減が達成され、低ランク法と比較してわずかに誤差が増加するにとどまる(低ランク法では35%の削減にとどまる)。
In this paper we propose and study a technique to reduce the number of parameters and computation time in fully-connected layers of neural networks using Kronecker product, at a mild cost of the prediction quality. The technique proceeds by replacing Fully-Connected layers with so-called Kronecker Fully-Connected layers, where the weight matrices of the FC layers are approximated by linear combinations of multiple Kronecker products of smaller matrices. In particular, given a model trained on SVHN dataset, we are able to construct a new KFC model with 73\% reduction in total number of parameters, while the error only rises mildly. In contrast, using low-rank method can only achieve 35\% reduction in total number of parameters given similar quality degradation allowance. If we only compare the KFC layer with its counterpart fully-connected layer, the reduction in the number of parameters exceeds 99\%. The amount of computation is also reduced as we replace matrix product of the large matrices in FC layers with matrix products of a few smaller matrices in KFC layers. Further experiments on MNIST, SVHN and some Chinese Character recognition models also demonstrate effectiveness of our technique.
研究の動機と目的
- ニューラルネットワークの全結合層におけるパラメータ数と計算時間を顕著に削減し、精度の著しい低下を防ぐ。
- 厳しいリソース制約下でもモデル性能を維持する構造的パラメータ圧縮技術を検討する。
- Kronecker積に基づく圧縮法と従来の低ランク近似法の有効性を、ニューラルネットワーク層において比較する。
- MNIST、SVHN、中国語漢字認識タスクを含む多様なデータセット上で、提案手法の有効性を評価する。
- Kroneckerに基づく圧縮を畳み込み層やRNNなどの他のアーキテクチャに拡張可能かどうかを調査する。
提案手法
- 全結合層の重み行列を、より小さな行列のクリプトーネル積の線形結合として近似することで、効率的なパrameter化を実現する。
- 2つの定式化を用いる:テンソル入力を想定したKFC-Iと、行列入力を想定したKFC-M。両者ともクリプトーネル積分解に依存する。
- クリプトーネル積分解を適用し、大きな重み行列を小さな低ランク成分の和として表現することで、ストレージと計算量を削減する。
- 微調整による学習を実施し、新しいKFC層のパラメータを入力データに適応させることで、近似後の一般化性能を向上させる。
- ランクrの行列は2つの小さな行列の積として表現可能であるという構造的制約を用い、クリプトーネル積分解による低ランク近似を可能にする。
- 複数のクリプトーネル積分解(定式化II、III、IV)を組み合わせることで、表現力の向上を図りつつも、圧縮率を維持する。
実験結果
リサーチクエスチョン
- RQ1Kronecker積に基づく分解は、ニューラルネットワークの全結合層を効果的に圧縮可能であり、モデル精度を維持できるか?
- RQ2標準データセット上でのKFC層のパラメータ削減と精度のトレードオフは、低ランク近似法と比較してどの程度優れているか?
- RQ3画像認識や文字認識などの実世界応用において、KFC層は計算量とモデルサイズをどの程度削減できるか?
- RQ4複数のクリプトーネル積定式化を組み合わせることで、高い圧縮率を維持しながらモデル性能が向上するか?
- RQ5Kronecker積技術は、畳み込み層や再帰層など、他の層に対しても拡張可能か?
主な発見
- SVHNデータセットでは、KFC-II手法が全結合層のパラメータを99.0%削減し、ベースラインと比較してテスト誤差が0.76%増加にとどまった。
- KFC-Combined手法は、全モデルパラメータを73.7%削減し、テスト誤差2.60%を達成。低ランク法(LowRank-64)の3.67%誤差(55.1%のパラメータ削減)を上回った。
- 中国語漢字認識タスクでは、KFC-KFCM-rank-10手法が全パラメータの91.8%を削減し、テスト誤差13.0%を達成。ランク1での性能損失の多くを回復した。
- KFC層は、元の全結合層と比較して、パラメータを99%以上削減でき、優れた圧縮効率を示した。
- SVHNではKFC法が73%の全パラメータ削減を達成し、精度損失を最小限に抑え、低ランク法が同程度の誤差制約下で達成した35%の削減を大きく上回った。
- KFC層構築後の微調整により、精度の低下が著しく緩和された。これにより、実用的かつ導入可能であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。