[论文解读] Efficient deep learning models for land cover image classification
本论文提出了一种基于复合缩放宽残差网络(WRNs)并结合高效通道注意力机制的轻量化、高效深度学习框架,用于使用BigEarthNet数据集进行土地覆盖分类。与ResNet50基线模型相比,该模型在平均F-score上提高了4.5%,参数量减少10倍,训练速度提升一倍,同时支持在多张GPU上进行分布式训练。
The availability of the sheer volume of Copernicus Sentinel imagery has created new opportunities for land use land cover (LULC) mapping at large scales using deep learning. Training on such large datasets though is a non-trivial task. In this work we experiment with the BigEarthNet dataset for LULC image classification and benchmark different state-of-the-art models, including Convolution Neural Networks, Multi-Layer Perceptrons, Visual Transformers, EfficientNets and Wide Residual Networks (WRN) architectures. Our aim is to leverage classification accuracy, training time and inference rate. We propose a framework based on EfficientNets for compound scaling of WRNs in terms of network depth, width and input data resolution, for efficiently training and testing different model setups. We design a novel scaled WRN architecture enhanced with an Efficient Channel Attention mechanism. Our proposed lightweight model has an order of magnitude less trainable parameters, achieves 4.5% higher averaged f-score classification accuracy for all 19 LULC classes and is trained two times faster with respect to a ResNet50 state-of-the-art model that we use as a baseline. We provide access to more than 50 trained models, along with our code for distributed training on multiple GPU nodes.
研究动机与目标
- 解决在BigEarthNet等大规模土地利用与土地覆盖(LULC)数据集上训练深度学习模型时面临的计算效率挑战。
- 通过卫星影像提升土地覆盖制图的分类准确率、训练速度和推理效率。
- 设计一种可扩展的轻量化架构,在显著减少参数量的同时保持高性能。
- 支持在多GPU节点上进行分布式训练,以加速模型开发与部署。
- 对多种最先进架构(CNN、Transformer、EfficientNets、WRNs)进行基准测试,以识别在准确率、速度和模型大小之间的最优权衡。
提出的方法
- 通过同时增加深度、宽度和输入分辨率,对宽残差网络(WRNs)实施复合缩放,以平衡模型容量与效率。
- 集成高效通道注意力机制,以极低的计算开销增强特征表示能力。
- 设计一种新型缩放WRN架构,在大幅减少可训练参数量的同时保持高性能。
- 使用包含19个LULC类别的多光谱卫星图像的BigEarthNet数据集进行模型训练与评估。
- 采用可扩展的训练框架,在多GPU节点上实现分布式训练,以加速收敛。
- 以F-score、训练时间与推理速度为指标,对包括ConvNets、MLPs、视觉Transformer、EfficientNets和WRNs在内的多种架构进行性能基准测试。
实验结果
研究问题
- RQ1对宽残差网络实施复合缩放,如何提升在大规模卫星数据集上土地覆盖分类的准确率与效率?
- RQ2集成高效通道注意力机制在参数量增加极少的情况下,对分类性能的提升程度如何?
- RQ3所提出的轻量化模型与ResNet50基线相比,在F-score、参数量和训练速度方面表现如何?
- RQ4分布式训练对大规模LULC分类任务中模型收敛性与可扩展性有何影响?
- RQ5在土地覆盖图像分类任务中,哪种深度学习架构在准确率、推理速度与模型大小之间实现了最佳权衡?
主要发现
- 与ResNet50基线相比,所提模型在全部19个土地利用与土地覆盖类别上的平均F-score提高了4.5%。
- 该模型的可训练参数量相比ResNet50基线减少了一个数量级,显著降低了模型复杂度。
- 与ResNet50基线相比,训练时间减少了一半,证明了训练效率的显著提升。
- 该框架支持在多GPU节点上进行分布式训练,实现了可扩展且加速的模型开发。
- 超过50个训练好的模型已公开发布,同时提供了分布式训练代码,显著提升了可复现性与可访问性。
- 在准确率-参数效率比方面,该模型优于其他最先进架构,包括Transformer和EfficientNets。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。