Skip to main content
QUICK REVIEW

[論文レビュー] HRViT: Multi-Scale High-Resolution Vision Transformer

Jiaqi Gu, Hyoukjun Kwon|arXiv (Cornell University)|Nov 1, 2021
Advanced Neural Network Applications参考文献 18被引用数 8
ひとこと要約

HRViTは、異種のマルチブランチ構造、線形層の冗長性低減、非線形性の増加を通じて、密度予測性能を向上させるマルチスケールで高解像度のビジョントランスフォーマー・アーキテクチャを導入した。ADE20Kでは50.20%のmIoU、Cityscapesでは83.16%のmIoUを達成し、MiT や CSWin といったSOTAモデルを+1.78 mIoU上回りながら、パラメータを28%削減、FLOPsを21%削減した。

ABSTRACT

Vision transformers (ViTs) have attracted much attention for their superior performance on computer vision tasks. To address their limitations of single-scale low-resolution representations, prior work adapts ViTs to high-resolution dense prediction tasks with hierarchical architectures to generate pyramid features. However, multi-scale representation learning is still under-explored on ViTs, given their classification-like sequential topology. To enhance ViTs with more capability to learn semantically-rich and spatially-precise multi-scale representations, in this work, we present an efficient integration of high-resolution multi-branch architectures with vision transformers, dubbed HRViT, pushing the Pareto front of dense prediction tasks to a new level. We explore heterogeneous branch design, reduce the redundancy in linear layers, and augment the model nonlinearity to balance the model performance and hardware efficiency. The proposed HRViT achieves 50.20% mIoU on ADE20K and 83.16% mIoU on Cityscapes for semantic segmentation tasks, surpassing state-of-the-art MiT and CSWin with an average of +1.78 mIoU improvement, 28% parameter reduction, and 21% FLOPs reduction, demonstrating the potential of HRViT as strong vision backbones.

研究の動機と目的

  • 密度予測タスクにおけるビジョントランスフォーマーのマルチスケールで高解像度の表現学習の限界を克服すること。
  • ViTの逐次的かつ分類指向のトポロジーが、効果的なマルチスケール特徴学習を妨げる問題を克服すること。
  • パフォーマンスと計算コストのバランスを取った効率的でハードウェアに優しいアーキテクチャを設計すること。
  • mIoUを向上させながらモデルサイズとFLOPsを削減することで、密度予測モデルのパレートフロンティアを押し広げること。

提案手法

  • HRViTは、複数スケールでの並列で異種の特徴学習を可能にするために、マルチブランチアーキテクチャをビジョントランスフォーマーに統合した。
  • ブランチ間でのパラメータ共有やプルーニングにより、線形層の冗長性を低減し、パラメータ効率を向上させた。
  • 非線形活性化関数をブランチ全体に戦略的に拡張することで、FLOPsを著しく増加させることなく表現能力を向上させた。
  • 高解像度の特徴をネットワーク全体にわたって維持する階層的設計を採用し、正確な空間的スーパービジョンを可能にした。
  • 空間的詳細を保持しつつ、クロススケール特徴統合を可能にする、特別に設計されたトークンミキシング機構を用いた。
  • 推論効率を最適化し、計算コストを低減しながら高い精度を達成するアーキテクチャとした。

実験結果

リサーチクエスチョン

  • RQ1解像度や効率性を損なわずに、ビジョントランスフォーマーが豊富なマルチスケール表現を効果的に学習できるか。
  • RQ2異種のマルチブランチ設計が、密度予測タスクにおけるViTの特徴学習をどのように向上させられるか。
  • RQ3パフォーマンスを維持または向上させながら、線形層の冗長性をどのように低減できるか。
  • RQ4FLOPsを増加させずに、ViTにおける非線形性をどの程度強化できるか。
  • RQ5HRViTは、セマンティックセグメンテーションベンチマークにおいて、既存のSOTAモデルを精度と効率の両面で上回ることができるか。

主な発見

  • HRViTはADE20Kのセマンティックセグメンテーションベンチマークで50.20%のmIoUを達成し、新たなSOTAを樹立した。
  • Cityscapesデータセットでは83.16%のmIoUを達成し、先行SOTAモデルを+1.78 mIoU上回った。
  • MiT や CSWin といったSOTAモデルと比較して、パラメータを28%削減した。
  • 優れたパフォーマンスを維持しながらFLOPsを21%削減し、ハードウェア効率の向上を示した。
  • マルチブランチで高解像度の設計により、特徴マップの空間的精度と意味的豊かさが向上した。
  • 非線形性とパラメータ共有の統合により、計算コストを増加させることなく表現能力が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。