[论文解读] CF-ViT: A General Coarse-to-Fine Method for Vision Transformer
CF-ViT 提出了一种适用于视觉 Transformer 的通用粗到细推理框架,通过先使用粗粒度补丁(7×7)对图像进行分类,并仅对不确定的预测进行细粒度补丁分割(14×14)来降低计算成本。该方法在不损失性能的前提下,相较于 LV-ViT 实现了 53% 的 FLOPs 减少和 2.01 倍的吞吐量提升,利用类别注意力识别出需要自适应细化的有信息量区域。
Vision Transformers (ViT) have made many breakthroughs in computer vision tasks. However, considerable redundancy arises in the spatial dimension of an input image, leading to massive computational costs. Therefore, We propose a coarse-to-fine vision transformer (CF-ViT) to relieve computational burden while retaining performance in this paper. Our proposed CF-ViT is motivated by two important observations in modern ViT models: (1) The coarse-grained patch splitting can locate informative regions of an input image. (2) Most images can be well recognized by a ViT model in a small-length token sequence. Therefore, our CF-ViT implements network inference in a two-stage manner. At coarse inference stage, an input image is split into a small-length patch sequence for a computationally economical classification. If not well recognized, the informative patches are identified and further re-split in a fine-grained granularity. Extensive experiments demonstrate the efficacy of our CF-ViT. For example, without any compromise on performance, CF-ViT reduces 53% FLOPs of LV-ViT, and also achieves 2.01x throughput.
研究动机与目标
- 减少由于对高分辨率补丁进行统一处理而引起的视觉 Transformer 中的计算冗余。
- 识别出可使用粗粒度补丁准确分类的图像,以节省计算资源。
- 仅对‘困难’图像中的有信息量区域使用细粒度补丁进行细化,从而保持准确性。
- 开发一种通用的、输入自适应的推理策略,适用于多种 ViT 架构。
提出的方法
- 模型采用两阶段推理流程:第一阶段使用 7×7 补丁,第二阶段对不确定样本使用 14×14 补丁。
- 利用最后编码器的类别注意力识别出需要进一步分割的有信息量补丁。
- 通过置信度阈值 η 决定是否进入精细阶段,实现计算的自适应。
- 知识蒸馏损失结合交叉熵与 KL 散度,使粗粒度和细粒度预测对齐。
- 该方法仅对有信息量的区域进行动态分割,避免对整张图像重新处理。
- 框架通过端到端训练,损失函数促使粗粒度预测与细粒度输出保持一致。
实验结果
研究问题
- RQ1粗粒度补丁分割(7×7)能否有效识别图像中的有信息量区域,以实现高效的 ViT 推理?
- RQ2少量粗粒度 token 是否足以在大多数图像上实现高准确率,从而降低整体 FLOPs?
- RQ3仅对有信息量的补丁进行自适应细化,是否在效率和准确性方面优于统一的细粒度处理?
- RQ4置信度阈值 η 的选择如何影响准确率与计算成本之间的权衡?
主要发现
- CF-ViT 相较于 LV-ViT 实现了 53% 的 FLOPs 减少和 2.01 倍的吞吐量提升,且无性能下降。
- 仅使用 7×7 补丁,DeiT-S 达到了 73.2% 的 top-1 准确率,表明大多数图像属于‘简单’类别,可实现粗粒度分类。
- 模型在粗粒度阶段正确分类了 76.8% 的图像,其余 23.2% 需要进行细粒度细化。
- 消融实验证明,有信息量区域的识别至关重要——若无此机制,由于整图重新分割,FLOPs 显著增加。
- 在损失函数和注意力加权组件中,设置 α = 0.5 和 β = 0.99 可实现准确率与效率的最佳平衡。
- CE+KL 损失函数优于 CE+CE,使精细阶段的准确率下降减少 0.5%,同时略微提升了粗粒度阶段的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。