Skip to main content
QUICK REVIEW

[论文解读] TOAST: Transfer Learning via Attention Steering

Baifeng Shi, Siyu Gai|arXiv (Cornell University)|May 24, 2023
Domain Adaptation and Few-Shot Learning被引用 5
一句话总结

TOAST 是一种新颖的迁移学习方法,通过在不微调主干网络的情况下重新聚焦注意力于与任务相关的特征,从而提升模型性能。它使用自上而下的注意力模块,选择性地增强自注意力层中的相关特征,实现了在 FGVC(86.2% 准确率)和指令遵循基准上的最先进结果,同时仅调整少量参数。

ABSTRACT

Transfer learning involves adapting a pre-trained model to novel downstream tasks. However, we observe that current transfer learning methods often fail to focus on task-relevant features. In this work, we explore refocusing model attention for transfer learning. We introduce Top-Down Attention Steering (TOAST), a novel transfer learning algorithm that keeps the pre-trained backbone frozen, selects task-relevant features in the output, and feeds those features back to the model to steer the attention to the task-specific features. By refocusing the attention only, TOAST achieves state-of-the-art results on a number of transfer learning benchmarks, while having a small number of tunable parameters. Compared to fully fine-tuning, LoRA, and prompt tuning, TOAST substantially improves performance across a range of fine-grained visual classification datasets (e.g., 81.1% -> 86.2% on FGVC). TOAST also outperforms the fully fine-tuned Alpaca and Vicuna models on instruction-following language generation. Code is available at https://github.com/bfshi/TOAST.

研究动机与目标

  • 解决现有迁移学习方法无法将模型注意力聚焦于与任务相关的特征的局限性。
  • 通过显式地重新聚焦注意力而非依赖参数更新,提升迁移学习中的下游性能。
  • 在极少参数调优的情况下实现最先进性能,避免全量微调带来的计算成本。
  • 探究仅通过注意力重聚焦是否能在保持参数效率的同时,超越完全微调的模型性能。

提出的方法

  • TOAST 引入了一个自上而下的注意力模块,从主干网络输出中选择与任务相关的特征,并将其反馈至每个自注意力层。
  • 该反馈信号通过调节注意力机制中的查询、键和值投影,增强对特定任务特征的关注。
  • 预训练的主干网络保持冻结,仅对自上而下的注意力模块在下游任务上进行微调。
  • 该方法在特征选择模块中使用逐标记和逐通道的注意力机制,以识别并增强相关的空间与通道特征。
  • TOAST-Lite 是一种参数高效的变体,在更少可调参数下达到与 TOAST 相当的性能,与 LoRA 相当。
  • 该方法包含一个预微调阶段,用于以更优的初始权重初始化自上而下的模块,从而提升收敛速度与性能。

实验结果

研究问题

  • RQ1在不微调主干网络的前提下,仅通过重新聚焦模型注意力于与任务相关的特征,能否提升迁移学习性能?
  • RQ2与全量微调及参数高效方法(如 LoRA 和提示微调)相比,自上而下的注意力引导在下游基准上的表现如何?
  • RQ3架构组件(如预微调和通道级注意力)对 TOAST 性能的影响是什么?
  • RQ4TOAST 是否能泛化到视觉之外的领域,例如在 LLaMA-7B 等大语言模型上用于指令遵循任务?
  • RQ5计算开销如何影响性能?是否能在不造成显著准确率损失的前提下降低?

主要发现

  • 在 FGVC 基准上,TOAST 达到 86.2% 的平均准确率,比完全微调的 ViT-B 提高 5%,比 LoRA 提高 5.1%。
  • 在 VTAB 基准上,TOAST 在 18 项任务中的 11 项上优于其他方法,展现出在多样化视觉任务中的广泛有效性。
  • 在指令遵循语言生成任务中,TOAST 超过完全微调的 Alpaca 和 Vicuna 模型,生成更详细且信息更丰富的回复。
  • TOAST-Lite 在 FGVC 上达到与 TOAST 相当的性能,同时仅调整少量参数,优于 LoRA 和 VPT 等具有相似参数效率的方法。
  • 消融研究显示,预微调至关重要——若移除该阶段,性能从 86.2% 降至 81.9%,尽管仍优于全量微调。
  • 移除通道级注意力的影响大于移除标记级注意力,表明通道级特征选择对性能至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。