[论文解读] Visual Transformer for Task-aware Active Learning
本文提出了一种新颖的任务感知联合学习框架,将视觉Transformer(VT)整合到主动学习中,以建模已标注与未标注样本之间的非局部依赖关系。通过联合训练学习器与采样器,利用已标注与未标注样本的判别器和任务特定损失,该方法在图像分类与目标检测基准上均实现了最先进性能,显著优于先前方法。
Pool-based sampling in active learning (AL) represents a key framework for an-notating informative data when dealing with deep learning models. In this paper, we present a novel pipeline for pool-based Active Learning. Unlike most previous works, our method exploits accessible unlabelled examples during training to estimate their co-relation with the labelled examples. Another contribution of this paper is to adapt Visual Transformer as a sampler in the AL pipeline. Visual Transformer models non-local visual concept dependency between labelled and unlabelled examples, which is crucial to identifying the influencing unlabelled examples. Also, compared to existing methods where the learner and the sampler are trained in a multi-stage manner, we propose to train them in a task-aware jointly manner which enables transforming the latent space into two separate tasks: one that classifies the labelled examples; the other that distinguishes the labelling direction. We evaluated our work on four different challenging benchmarks of classification and detection tasks viz. CIFAR10, CIFAR100,FashionMNIST, RaFD, and Pascal VOC 2007. Our extensive empirical and qualitative evaluations demonstrate the superiority of our method compared to the existing methods. Code available: https://github.com/razvancaramalau/Visual-Transformer-for-Task-aware-Active-Learning
研究动机与目标
- 通过在早期训练阶段利用未标注数据,解决主动学习中的冷启动问题。
- 通过建模已标注与未标注样本之间的非局部视觉依赖关系,改进池化型主动学习中的样本选择。
- 开发一种联合学习框架,同时优化下游任务性能与信息性样本选择。
- 首次将视觉Transformer适配至主动学习,实现超越局部特征的长距离视觉概念建模。
- 在多样化的基准上展示泛化能力,涵盖真实数据与合成数据,适用于分类与目标检测任务。
提出的方法
- 在卷积特征提取器与最终分类器之间集成视觉Transformer(VT)模块,以建模一批样本中已标注与未标注样本之间的非局部交互关系。
- 采用联合学习目标,同时最小化下游任务损失(如分类任务的交叉熵损失,检测任务的SSD损失)与已标注-未标注判别器损失。
- 将已标注与未标注样本的每个特征表示作为VT输入中的独立标记,实现批次内跨样本注意力机制。
- 在VT处理后的特征空间中进行不确定性估计,以指导选择在视觉上独特且信息量大的未标注样本。
- 通过在SSD置信度头处放置VT瓶颈并使用SSD损失作为任务特定目标,将架构适配至目标检测任务。
- 通过在增强的真实数据(RaFD)与合成数据(StarGAN生成)人脸表情数据上进行训练,将框架扩展至合成数据子采样任务。
实验结果
研究问题
- RQ1视觉Transformer能否有效建模已标注与未标注样本之间的非局部视觉依赖关系,从而提升主动学习性能?
- RQ2通过共享目标联合训练学习器与采样器,是否相比多阶段训练能实现更优的样本选择与模型泛化能力?
- RQ3所提出方法在多样化基准上的表现如何,包括图像分类与目标检测任务?
- RQ4该方法能否泛化至合成数据子采样任务?在该设置下是否优于现有方法?
- RQ5架构选择(如批量大小与VT深度)对框架可扩展性与性能有何影响?
主要发现
- 所提方法TJLS(基于视觉Transformer的任务感知联合学习)在CIFAR10、CIFAR100、FashionMNIST、RaFD与Pascal VOC 2007上均达到最先进性能。
- 在Pascal VOC 2007目标检测任务中,TJLS在7次样本选择阶段后mAP超过76%,显著优于先前最先进方法(如Learning Loss与CDAL)。
- 在从StarGAN生成的合成人脸表情数据中进行子采样时,该方法显著优于现有基线模型,展现出对合成数据增强的强大泛化能力。
- 采用基于VT的采样策略的联合学习框架,相比基线方法在早期阶段表现出更低的性能饱和度,尤其在数据稀缺时优势明显。
- 即使在数据有限的情况下,该方法仍保持鲁棒性,在多个基准上持续获得性能增益,有效缓解了冷启动问题。
- TJLS在所有基准上均优于JLS(无VT版本),证实通过视觉Transformer建模非局部依赖关系具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。