[論文レビュー] Vision Transformer with Attention Map Hallucination and FFN Compaction
本稿では、自己注意機構(MHSA)とフィードフォワードネットワーク(FFN)における冗長性を活用することで、ビジョントランスフォーマーの計算複雑度を低減するため、 hallucinated-MHSA(hMHSA)と compact-FFN(cFFN)を提案する。hMHSAは、片方の注意マップから安価な演算で残りの半分を生成することで、完全なQ-K相関計算を回避する。一方、cFFNは行列因子分解と再パラメータ化を用いてFFNを圧縮し、DeiT、NextViT、PVTバックボーンにおいて10%-20%のFLOPsおよびパラメータ削減を達成しながら、競争力ある精度を維持する。
Vision Transformer(ViT) is now dominating many vision tasks. The drawback of quadratic complexity of its token-wise multi-head self-attention (MHSA), is extensively addressed via either token sparsification or dimension reduction (in spatial or channel). However, the therein redundancy of MHSA is usually overlooked and so is the feed-forward network (FFN). To this end, we propose attention map hallucination and FFN compaction to fill in the blank. Specifically, we observe similar attention maps exist in vanilla ViT and propose to hallucinate half of the attention maps from the rest with much cheaper operations, which is called hallucinated-MHSA (hMHSA). As for FFN, we factorize its hidden-to-output projection matrix and leverage the re-parameterization technique to strengthen its capability, making it compact-FFN (cFFN). With our proposed modules, a 10$\%$-20$\%$ reduction of floating point operations (FLOPs) and parameters (Params) is achieved for various ViT-based backbones, including straight (DeiT), hybrid (NextViT) and hierarchical (PVT) structures, meanwhile, the performances are quite competitive.
研究の動機と目的
- ビジョントランスフォーマーにおけるマルチヘッド自己注意(MHSA)とフィードフォワードネットワーク(FFN)のコンponentに見過ごされがちな冗長性に対処すること。
- モデル性能を損なわず、計算複雑度(FLOPsおよびパラメータ)を低減すること。
- MHSAにおける注意マップが相関しているかどうかを検証し、完全に計算する代わりに、それらを「幻視化(hallucinated)」することで処理可能かどうかを調査すること。
- 行列因子分解と再パラメータ化を用いて、表現能力を保持しつつもコンactなFFNを再設計すること。
- hMHSAとcFFNが、直列型(DeiT)、ハイブリッド型(NextViT)、階層型(PVT)を含む多様なViTアーキテクチャに一般化可能かどうかを検証すること。
提案手法
- hMHSAを提案し、片方の注意マップから安価な演算で残りの半分を生成することで、完全なQ-K相関計算を回避する。
- FFNの隠れ層から出力層への射影行列に対して行列因子分解を適用し、冗長性を低減し、パラメータ数を削減する。
- 因子化されたFFNに再パラメータ化技術を適用し、複数のトレーニング時ブランチから、1つの強力な推論時フォワードパスを生成可能にする。
- cFFNにおける圧縮度を制御するためのコンパクト比tを用い、精度と効率のトレードオフにおいてt=2/3が最適であると特定する。
- DeiT、NextViT、PVTv2など、多様なViTバックボーンにhMHSAとcFFNを適用し、競争力ある性能を維持する。
- アブレーションスタディを用いて、再パラメータ化ブランチ数(r)、異なる行列(M1対M2)への因子分解、および圧縮比(t)の影響を評価する。
実験結果
リサーチクエスチョン
- RQ1MHSAにおける冗長な注意マップは、完全なQ-K相関計算の代わりに、安価な演算で効果的に幻視化可能か?
- RQ2FFNの射影行列に対する行列因子分解は、冗長性を低減しつつモデルの表現能力を保持できるか?
- RQ3再パラメータ化は、推論コストを増加させることなく、圧縮されたFFNの性能をどのように向上させるか?
- RQ4提案されたcFFNモジュールにおいて、圧縮比と精度の最適なバランスは何か?
- RQ5hMHSAとcFFNは、直列型、ハイブリッド型、階層型を含む多様なViTアーキテクチャに効果的に一般化可能か?
主な発見
- hMHSAは、片方の注意マップからもう片方を幻視化することで、MHSAの計算量を削減し、性能の低下を最小限に抑えつつ顕著なFLOPsおよびパラメータ削減を達成する。
- 行列因子分解と再パラメータ化を施したcFFNは、DeiT、NextViT、PVTなど複数のViTバックボーンで10%-20%のFLOPsおよびパラメータ削減を実現しながら、競争力ある精度を維持する。
- アブレーションスタディの結果、隠れ層から出力層への射影行列(M2)への因子分解が、入力層から隠れ層への射影行列(M1)への因子分解よりも優れた性能を示し、0.2%の精度向上を達成した。
- cFFNにおける再パラメータ化ブランチ数r=2が、性能とトレーニングコストの最良のトレードオフを実現し、r=1やr=3を上回る性能を示した。
- cFFNにおける最適な圧縮比t=2/3は、PVTv2-b1で70.2%のトップ-1精度を達成し、FLOPsとパラメータが等しい状態でベースラインを0.3%上回った。
- CIFAR-100およびStanford-Dogにおける転移学習の結果、提案モデルは元のモデルと同等またはわずかに優れた性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。