[论文解读] Cheaper Pre-training Lunch: An Efficient Paradigm for Object Detection
本文提出了一种名为 Montage 预训练的新颖且高效的物体检测预训练范式,仅使用目标检测数据集进行预训练,无需依赖外部数据(如 ImageNet),同时将计算成本降低 4 倍。通过以马赛克格式整合信息丰富的样本,并采用 ERF 自适应的密集分类方法,该方法在检测性能上达到或超过 ImageNet 预训练的效果,显著提升了训练效率,且未牺牲准确性。
In this paper, we propose a general and efficient pre-training paradigm, Montage pre-training, for object detection. Montage pre-training needs only the target detection dataset while taking only 1/4 computational resources compared to the widely adopted ImageNet pre-training.To build such an efficient paradigm, we reduce the potential redundancy by carefully extracting useful samples from the original images, assembling samples in a Montage manner as input, and using an ERF-adaptive dense classification strategy for model pre-training. These designs include not only a new input pattern to improve the spatial utilization but also a novel learning objective to expand the effective receptive field of the pretrained model. The efficiency and effectiveness of Montage pre-training are validated by extensive experiments on the MS-COCO dataset, where the results indicate that the models using Montage pre-training are able to achieve on-par or even better detection performances compared with the ImageNet pre-training.
研究动机与目标
- 消除物体检测器预训练对外部大规模分类数据集(如 ImageNet)的依赖。
- 在保持或提升检测性能的同时,降低预训练的计算成本。
- 通过聚焦信息丰富的样本并提升空间与特征利用效率,解决训练中的冗余问题。
- 开发一种通用、高效且与数据无关的预训练范式,适用于多种检测框架与主干网络。
提出的方法
- 从检测数据集图像中提取正样本与负样本,以减少背景冗余。
- 通过保持长宽比感知的排布方式,将样本组装成马赛克图像,以最大化空间利用率。
- 采用重采样与裁剪策略,并结合数据增强(如随机翻转、尺度抖动)以标准化输入尺寸。
- 使用 ERF 自适应的密集分类方法,根据有效感受野(ERF)分配软标签,以增强特征学习。
- 采用全局与分块分类策略,其中 ERF 自适应方法表现优于两者。
- 使用 ERF 加权标签分配的标准交叉熵损失,在马赛克图像上训练主干网络。
实验结果
研究问题
- RQ1是否可以不依赖 ImageNet 等外部数据集,实现高效的对象检测预训练?
- RQ2如何减少标准预训练中冗余的背景像素,以提升计算效率?
- RQ3是否可仅基于检测数据的预训练策略实现与 ImageNet 预训练相当的性能?
- RQ4空间布局与标签分配策略对预训练效果有何影响?
- RQ5与全局或分块分类相比,ERF 自适应密集分类是否能提升特征表示能力?
主要发现
- 在使用 ResNet-50 的 COCO val2017 上,Montage 预训练达到 36.3 AP,优于相同训练设置下的 ImageNet 预训练(34.3 AP)。
- ERF 自适应密集分类策略达到 38.9 AP75,显著优于分块分类(37.6)与全局分类(36.3)。
- 与 ImageNet-1k 预训练相比,该方法将预训练计算量减少了 4 倍,且仅使用检测数据集。
- 采用“填充并裁剪”方法进行尺度调整时性能最佳(35.2 AP),优于“变形”(34.6)与“重采样”(34.7)。
- 该方法具有良好的泛化能力,在多种检测框架与主干网络上均表现出一致的性能提升。
- Montage 预训练实现了更快的收敛速度,且在无需外部数据或增加训练成本的前提下,保持了竞争力的准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。