Skip to main content
QUICK REVIEW

[论文解读] Dynamic Group Transformer: A General Vision Transformer Backbone with Dynamic Group Attention

Kai Liu, Tianyi Wu|arXiv (Cornell University)|Mar 8, 2022
Advanced Image and Video Retrieval Techniques被引用 4
一句话总结

本文提出动态分组Transformer(DGT),一种通用视觉Transformer主干网络,用动态分组注意力(DG-Attention)替代固定窗口自注意力机制,该机制根据内容相似性自适应地将查询聚类为组,并为每组选择相关的键/值。该方法在图像分类、语义分割、目标检测和实例分割任务中均达到最先进性能,其中DGT-T在ImageNet-1k上达到83.8%的Top-1准确率,DGT-B达到85.0%的Top-1准确率。

ABSTRACT

Recently, Transformers have shown promising performance in various vision tasks. To reduce the quadratic computation complexity caused by each query attending to all keys/values, various methods have constrained the range of attention within local regions, where each query only attends to keys/values within a hand-crafted window. However, these hand-crafted window partition mechanisms are data-agnostic and ignore their input content, so it is likely that one query maybe attends to irrelevant keys/values. To address this issue, we propose a Dynamic Group Attention (DG-Attention), which dynamically divides all queries into multiple groups and selects the most relevant keys/values for each group. Our DG-Attention can flexibly model more relevant dependencies without any spatial constraint that is used in hand-crafted window based attention. Built on the DG-Attention, we develop a general vision transformer backbone named Dynamic Group Transformer (DGT). Extensive experiments show that our models can outperform the state-of-the-art methods on multiple common vision tasks, including image classification, semantic segmentation, object detection, and instance segmentation.

研究动机与目标

  • 为解决视觉Transformer中固定窗口注意力机制的局限性,其为数据无关机制,可能关注无关的键/值。
  • 在保持长距离依赖建模能力的同时,降低全局自注意力机制的二次方计算复杂度。
  • 设计一种灵活、内容依赖的注意力机制,能够动态分组查询并选择相关键/值,且不受空间限制。
  • 构建一种通用视觉Transformer主干网络,在多种视觉任务中均表现优异。

提出的方法

  • 动态分组注意力(DG-Attention)根据查询与学习得到的聚类中心之间的相似性,动态地将查询划分为若干组,实现内容感知的分组。
  • 对于每组查询,使用聚类中心从完整键/值集合中选择最相关的子集,从而减少无关注意力的计算。
  • 通过允许所选键在特征图上分散分布,而非局限于局部窗口,避免了空间约束。
  • 分组机制具有可微性,支持端到端训练,实现聚类与注意力的联合优化。
  • 通过限制每组的注意力范围,并采用组内矩阵乘法,保持计算效率,提升GPU计算效率。
  • DGT主干网络被扩展为多种变体(DGT-T、DGT-S、DGT-B),参数量分别为2400万、5200万和9000万,以满足多样化的部署需求。

实验结果

研究问题

  • RQ1能否通过基于输入依赖的查询分组动态选择相关键,使内容自适应的注意力机制在视觉Transformer中优于固定窗口注意力?
  • RQ2如何通过动态查询分组在降低计算成本的同时,保留高分辨率特征图中的长距离依赖关系?
  • RQ3具备动态分组机制的通用视觉Transformer主干网络在多种视觉任务中能达到何种程度的最先进性能?
  • RQ4在键选择过程中摒弃空间约束,是否能提升对非局部、语义相关特征的建模能力?

主要发现

  • DGT-T在ImageNet-1k上达到83.8%的Top-1准确率,超越了以往最先进方法在图像分类任务上的表现。
  • 在ADE20K数据集上,DGT-T实现50.2%的mIoU用于语义分割,优于现有方法。
  • 在COCO数据集的目标检测任务中,DGT-T取得47.7%的box mAP,展现出在密集预测任务中的强大泛化能力。
  • DGT-B在ImageNet-1k上达到85.0%的Top-1准确率,在ADE20K上实现51.2%的mIoU,刷新了分类与分割任务的最先进结果。
  • 可视化结果表明,不同查询组关注的是分散分布的、语义相关的键,而非局限于局部窗口。
  • 所提出的组内矩阵乘法实现方式支持高效的GPU计算,显著降低全局显存占用,有利于大规模训练与推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。