Skip to main content
QUICK REVIEW

[論文レビュー] ResT V2: Simpler, Faster and Stronger

Qinglong Zhang, Yu-Bin Yang|arXiv (Cornell University)|Apr 15, 2022
Image Processing Techniques and Applications被引用数 14
ひとこと要約

本稿では、ダウンサンプリングによる高周波成分の損失を回復するために、EMSAにおけるマルチヘッド相互作用をピクセルシャッフルアップサンプリング戦略に置き換えることで、性能を向上させたより単純で高速かつ強力なビジョントランスフォーマーベース、ResT V2を提案する。ResT V2は、Swin Transformer や ConvNeXt よりも少ないパラメータ数と高いスループットで、ImageNet、COCO、ADE20K において最先端の精度を達成した。

ABSTRACT

This paper proposes ResTv2, a simpler, faster, and stronger multi-scale vision Transformer for visual recognition. ResTv2 simplifies the EMSA structure in ResTv1 (i.e., eliminating the multi-head interaction part) and employs an upsample operation to reconstruct the lost medium- and high-frequency information caused by the downsampling operation. In addition, we explore different techniques for better apply ResTv2 backbones to downstream tasks. We found that although combining EMSAv2 and window attention can greatly reduce the theoretical matrix multiply FLOPs, it may significantly decrease the computation density, thus causing lower actual speed. We comprehensively validate ResTv2 on ImageNet classification, COCO detection, and ADE20K semantic segmentation. Experimental results show that the proposed ResTv2 can outperform the recently state-of-the-art backbones by a large margin, demonstrating the potential of ResTv2 as solid backbones. The code and models will be made publicly available at \url{https://github.com/wofmanaf/ResT}

研究の動機と目的

  • 計算コストを削減しながら性能に妥協をきたさない、より効率的で正確なビジョントランスフォーマーベースの開発。
  • マルチヘッド自己注意機構におけるダウンサンプリングに起因する性能劣化を是正するため、失われた高周波成分を再構築すること。
  • 理論的FLOPsが低いことが常に高速な推論を意味するという仮定に疑問を呈すること、特にGPUハードウェア上での場合。
  • 検出やセグメンテーションなどの下流ビジョンタスクへのResT V2ベースの有効な適用法の探求。

提案手法

  • 複雑性を低減するため、マルチヘッド相互作用部を除去した簡素化されたマルチヘッド自己注意モジュールであるEMSAv2を提案。
  • EMSAv2にピクセルシャッフルアップサンプリング操作を導入し、ダウンサンプリング中に失われた中・高周波成分を再構築。
  • 「ダウンサンプリング・アップサンプリング」操作を通じて、軽量で畳み込みベースのアワークラスチャネル構造を設計し、局所的特徴学習を強化。
  • 訓練の安定化と特徴表現の向上のため、残差接続構造を採用。
  • 下流タスクへのResT V2の展開戦略を複数検証し、ウィンドウアテンションまたはグローバルアテンションと組み合わせる手法を評価。
  • GPUハードウェア上での理論的FLOPsと実際の推論速度のトレードオフを分析するためのアブレーションスタディを実施。

実験結果

リサーチクエスチョン

  • RQ1EMSAにおけるマルチヘッド相互作用を削除することで、性能に悪影響を及げることなく効率性が向上するか?
  • RQ2ピクセルシャッフルによるアップサンプリングが、自己注意機構におけるダウンサンプリングによる情報損失を効果的に回復できるか?
  • RQ3理論的FLOPsを低く抑えているにもかかわらず、EMSAv2にウィンドウアテンションを組み合わせると実際の推論速度が低下するのはなぜか?
  • RQ4検出やセグメンテーションを含む多様なビジョンタスクにおいて、Swin Transformer や ConvNeXt といった最先端のバックボーンと比較して、ResT V2は精度と速度の両面で優れているか?
  • RQ5現代のGPUハードウェア上では、理論的FLOPsと実際の推論速度の相関関係はどの程度強いのか?

主な発見

  • ResT V2-Lは、87MパラメータでImageNet-1kで84.2%のTop-1精度を達成し、Swin-B(83.5%)とConvNeXt-B(83.8%)を上回り、415画像/秒のスループットを達成した。
  • COCOオブジェクト検出タスクにおいて、ResT V2-Tは47.6のボックスAPと43.2のマスクAPを達成し、Swin-T(+1.6 AP)とConvNeXt-T(+1.4 AP)を上回り、25.0 FPSという高い推論速度(Swin-T:21.8 FPS、ConvNeXt-T:23.4 FPS)を実現した。
  • ADE20Kセマンティックセグメンテーションタスクにおいて、ResT V2-Tは47.3 mIoUを達成し、Swin-T(45.8)とConvNeXt-T(46.7)を上回り、22.4 FPSの推論速度を記録した。これはそれぞれ5.3%および12.6%の速度向上に相当する。
  • ADE20Kにおいて、ResT V2-Bは49.6 mIoUを達成し、Swin-S(49.2)とConvNeXt-B(49.0)をそれぞれ0.4および0.6 mIoU上回り、19.2 FPSの推論速度を記録した。これはSwin-Sに比べて30.6%の速度向上に相当する。
  • 研究では、ウィンドウアテンションがGPU上での計算密度を低下させ、理論的FLOPsが低くても実際の推論速度が遅くなることが判明した。これは、FLOPsが速度を予測するという一般的な仮定に疑問を呈するものである。
  • EMSAv2における「ダウンサンプリング・アップサンプリング」機構により、パラメータと計算量の増加を最小限に抑えつつ、局所的特徴学習を強化する軽量なアワークラスチャネル構造が構築された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。