[論文レビュー] Evolving and understanding sparse deep neural networks using cosine similarity
本論文では、コサイン類似度を用いてトポロジー進化をガイドすることで、スパースな深層ニューラルネットワークをスクラッチから訓練する脳にインspiredされたアルゴリズムCTREを提案する。繰り返し、小さな重みをプルーニングし、密度の高い勾配に依存せずに類似度が最も高い接続を追加することで、8つの多様なデータセットにおいて極めてスパースな領域で最先端の性能を達成し、既存の手法と比べて大きく性能を上回りながら、効率的で低リソースな訓練を可能にする。
Training sparse neural networks with adaptive connectivity is an active research topic. Such networks require less storage and have lower computational complexity compared to their dense counterparts. The Sparse Evolutionary Training (SET) procedure uses weights magnitude to evolve efficiently the topology of a sparse network to fit the dataset, while enabling it to have quadratically less parameters than its dense counterpart. To this end, we propose a novel approach that evolves a sparse network topology based on the behavior of neurons in the network. More exactly, the cosine similarities between the activations of any two neurons are used to determine which connections are added to or removed from the network. By integrating our approach within the SET procedure, we propose 5 new algorithms to train sparse neural networks. We argue that our approach has low additional computational complexity and we draw a parallel to Hebbian learning. Experiments are performed on 8 datasets taken from various domains to demonstrate the general applicability of our approach. Even without optimizing hyperparameters for specific datasets, the experiments show that our proposed training algorithms usually outperform SET and state-of-the-art dense neural network techniques. The last but not the least, we show that the evolved connectivity patterns of the input neurons reflect their impact on the classification task.
研究の動機と目的
- 低リソースデバイスにおける密度の高いニューラルネットワークの訓練にかかる計算コストとメモリコストを低減すること。
- 既存のスパース訓練手法の限界、例えば密度の高い勾配に依存する点や、高スパース性における性能の低さを克服すること。
- 生物学的に妥当で、効率的かつスケーラブルな、スパースニューラルネットワークをスクラッチから訓練するための手法を開発すること。
- エッジデバイスやデータセンターに適したスパースモデルを支援することで、エネルギー効率の良いAIを実現すること。
提案手法
- CTREアルゴリズムは、各エポックで最小の重みを持つ接続をプルーニングすることで、スパースなニューラルネットワークのトポロジーを進化させる。
- 隣接層のニューロン活性化値の間のコサイン類似度行列を計算し、追加すべき最も重要な接続を同定する。
- 以前にプルーニングされていない、類似度が最も高い接続を追加することで、スパースな勾配計算を保証する。
- 最高類似度の接続がプルーニングされていた場合、ランダムな接続を挿入することで、局所最適解からの脱出を可能にする。
- 密度の高い重みに対する完全な逆伝播を伴わず、スパースで反復的な方法でプルーニングと接続追加を交互に繰り返す。
- 2つのバリエーションを評価:CTRE seq(逐次的)およびCTRE sim(同時的)な類似度とランダム性の探索。

実験結果
リサーチクエスチョン
- RQ1密度の高い勾配計算を伴わず、ニューロン活性化値間のコサイン類似度が、スパースニューラルネットワークのトポロジー進化を効果的にガイドできるか。
- RQ2CTREは、最先端のスパース訓練手法と比較して、極めてスパースな領域でどのように性能を発揮するか。
- RQ3ランダム探索の統合により、高スパース性環境下でCTREが悪い局所最適解に収束するのを防げるか。
- RQ4CTREは、低リソースデバイス向けに、低計算コスト・低メモリオーバーヘッドを維持しながら、競争力のある性能を達成できるか。
主な発見
- CTREは、極めてスパースなニューラルネットワークにおいて、すべての最先端のスパース訓練アルゴリズムを上回り、一部のデータセットでは最大15%の精度向上を達成した。
- MNISTおよびCIFAR-10データセットでは、95%のスパース性において、密度ベースラインのテスト精度の1%以内にまで到達したが、他の手法は収束しなかった。
- 大規模なネットワークにおける訓練損失曲線から、CTREの収束速度は、特に高スパース性領域において、ベースライン手法よりも顕著に速いことが示された。
- アブレーションスタディにより、ランダム探索が不可欠であることが確認された:Isoletデータセットでは、CTRE w/oRandomは200エポックを過ぎても局所最適解に閉じ込められ、改善が見られなかった。
- コサイン類似度は、中程度および高重要度の範囲で、重要な接続を特定するのに対して非常に有効であり、スパースな環境下で、重みの大きさに基づく順序付けを上回った。
- 本手法により、密度の高い勾配を伴わず、スパースネットワークをスクラッチから訓練可能となり、低リソースデバイスへのデプロイに適している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。