Skip to main content
QUICK REVIEW

[論文レビュー] Bi-directional Masks for Efficient N:M Sparse Training

Yuxin Zhang, Yiting Luo|arXiv (Cornell University)|Feb 13, 2023
Speech and Audio Processing被引用数 6
ひとこと要約

本稿では、前向きおよび後向きの重みスパarsityを別々のマスクで分離することで、N:Mスパーストレーニングにおける効率的かつ高性能な手法である、二方向マスク(Bi-Mask)を提案する。この手法により、N:Mスパーステンソルコア上で前向きおよび後向きの両方の計算を完全に高速化でき、性能劣化なしに実現される。前向きマスクの適用前に効率的な行の並べ替えを施すことで、高いモデル精度を維持しつつ、既存手法に比べて優れたトレーニング効率を達成する。

ABSTRACT

We focus on addressing the dense backward propagation issue for training efficiency of N:M fine-grained sparsity that preserves at most N out of M consecutive weights and achieves practical speedups supported by the N:M sparse tensor core. Therefore, we present a novel method of Bi-directional Masks (Bi-Mask) with its two central innovations in: 1) Separate sparse masks in the two directions of forward and backward propagation to obtain training acceleration. It disentangles the forward and backward weight sparsity and overcomes the very dense gradient computation. 2) An efficient weight row permutation method to maintain performance. It picks up the permutation candidate with the most eligible N:M weight blocks in the backward to minimize the gradient gap between traditional uni-directional masks and our bi-directional masks. Compared with existing uni-directional scenario that applies a transposable mask and enables backward acceleration, our Bi-Mask is experimentally demonstrated to be more superior in performance. Also, our Bi-Mask performs on par with or even better than methods that fail to achieve backward acceleration. Project of this paper is available at \url{https://github.com/zyxxmu/Bi-Mask}.

研究の動機と目的

  • N:Mスパーストレーニングにおける非効率性を是正する。これは、スパーステンソルコアのハードウェア支援にもかかわらず、後向き伝播が密行列計算となることが原因である。
  • 既存手法がスパースネスパターンを制限する剛性のある転置可能なマスクを用いることで生じる性能劣化を克服する。
  • N:Mスパーストレーニングにおいて、前向きおよび後向きの両方の高速化を実現するとともに、モデルの精度を維持する。
  • スパーストレーニングにおける前向きおよび後向きの勾配ギャップを最小限に抑える、柔軟かつ効率的なメカニズムを構築する。
  • 二方向マスクと知的な並べ替えを組み合わせることで、非高速化されたスパーストレーニング手法に匹敵またはそれを上回る性能を達成できることを示す。

提案手法

  • 前向き伝播(行)用と後向き伝播(列)用の2つの独立したN:Mスパースマスクを導入し、前向きおよび後向きのスパースネスパターンを分離する。
  • 後向きマスクを計算する前に、重み行列に対して効率的な行の並べ替えを施し、有効なN:Mブロックの数を最大化する。
  • 並べ替えられた重みに対して大きさに基づくプルーニングを適用し、後向きマスクを生成することで、N:Mスパーステンソルコア高速化と整合性を保つ。
  • 出力勾配の列順序を並べ替えられた重み行列と一致させることで、勾配の一貫性を維持し、勾配ギャップを最小限に抑える。
  • グリーディ探索のコストを避けるために、N:Mブロック数を基準に、小さな候補集合(例:12個)から最良の並べ替えを選択する。
  • 後向きマスクの二値化基準として重みの大きさを用いることで、前向きマスクと整合性を持たせ、勾配差を低減する。
(a) Vanilla N:M Mask
(a) Vanilla N:M Mask

実験結果

リサーチクエスチョン

  • RQ1転置可能なマスクの制約を課さずに、N:Mスパーストレーニングにおける前向きおよび後向きの両方の高速化を達成できるか?
  • RQ2前向きおよび後向きのスパースネスマスクを分離することで、モデルの性能とトレーニング効率にどのような影響を与えるか?
  • RQ3効率的な行の並べ替え戦略は、後向き伝播における有効なN:Mブロック数を増加させるとともに、勾配ギャップを最小限に抑えることができるか?
  • RQ4Bi-Maskは、性能を犠牲にしてまで高速化を図るか、あるいは後向き伝播を高速化できない既存手法を上回るか?
  • RQ5異なる二値化基準が、後向きマスクの有効性および全体のモデル精度に与える影響は何か?

主な発見

  • Bi-Maskは、前向きおよび後向きのスパースネスパターンを分離することで、N:Mスパーステンソルコア上で前向きおよび後向きの両方の高速化を実現する。
  • 特に1:8や1:16のような高スパースネスレベルにおいて、転置可能なマスクを用いる既存手法と比較して、性能劣化が顕著に低減される。
  • アブレーションスタディの結果、後向きマスクの追加によるトップ1精度の低下は0.3%にとどまり、並べ替えの更新によりベースラインから0.3%の精度向上が達成された。
  • 二値化基準の比較において、重みの大きさを用いることで最良の性能(2:4スパースネスにおけるResNet-18で70.73%のトップ1精度)が得られ、勾配の大きさ(70.56%)やランダム選択(67.76%)を上回った。
  • 限定された候補集合(例:12個)からの並べ替え戦略は、近似的に最適なN:Mブロック数を達成するのに十分であり、計算コストも低い。
  • 転置可能なマスクに依存するSOTA手法を上回り、非高速化されたベースラインでさえも上回る精度を達成しており、効率性と有効性の両面で優れた性能を示している。
(b) Transposable N:M Mask
(b) Transposable N:M Mask

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。