[论文解读] Image Augmentation for Multitask Few-Shot Learning: Agricultural Domain Use-Case
本文提出了一种多任务图像增强框架 MultiPartAugmentor,通过结合不同变换(包括缩放、旋转、噪声注入和背景融合)从少量植物图像中合成多样化的训练场景。在使用 IPPN 数据集进行语义分割任务时,该方法在 DeepLabV3 模型上相比标准增强方法实现了 9% 的相对 F1 分数提升,相比无增强方法提升了 12%。
Large datasets' availability is catalyzing a rapid expansion of deep learning in general and computer vision in particular. At the same time, in many domains, a sufficient amount of training data is lacking, which may become an obstacle to the practical application of computer vision techniques. This paper challenges small and imbalanced datasets based on the example of a plant phenomics domain. We introduce an image augmentation framework, which enables us to extremely enlarge the number of training samples while providing the data for such tasks as object detection, semantic segmentation, instance segmentation, object counting, image denoising, and classification. We prove that our augmentation method increases model performance when only a few training samples are available. In our experiment, we use the DeepLabV3 model on semantic segmentation tasks with Arabidopsis and Nicotiana tabacum image dataset. The obtained result shows a 9% relative increase in model performance compared to the basic image augmentation techniques.
研究动机与目标
- 解决农业计算机视觉中植物图像数据集数量有限、分布不均且质量较低的挑战。
- 在植物表型组学中实现有效的少样本学习,因为收集大规模标注数据集成本高且耗时长。
- 开发一种高效、实时生成的图像增强系统,支持从极少输入数据中完成多种视觉任务(分割、检测、分类)。
- 通过保留语义和结构真实感的合成数据,提升模型的泛化能力和性能。
提出的方法
- 提出 MultiPartAugmentor 框架,通过随机变换(如缩放、旋转和噪声注入)组合多个植物对象,生成合成场景。
- 引入基于对象的增强方法,使用缩放比(s)、方向系数(θ)和随机背景选择等参数,以提升场景多样性。
- 采用场景生成流水线,在将对象组合成场景前分别对每个对象应用变换,并自动生成边界框和掩码。
- 通过 Albumentations 库应用数据增强规则,包括 HorizontalFlip、VerticalFlip、ShiftScaleRotate 和 GridDistortion,用于基线比较。
- 模型训练采用 DeepLabV3 模型,主干网络为 ResNet-101,损失函数为带 logits 的二元交叉熵,学习率采用调度策略以确保评估的一致性。
- 通过公式 M = 3n¯h¯w[(1+m)p + o + 2] + õ 估算内存使用量,以确保在合理内存约束下实现实时生成。
实验结果
研究问题
- RQ1合成图像增强框架是否能在植物图像数据有限的少样本学习场景中显著提升模型性能?
- RQ2与标准增强方法相比,支持分割、检测和分类的多任务增强在语义分割准确率方面表现如何?
- RQ3基于对象的组合与随机变换在多大程度上提升了植物表型组学中模型的泛化能力?
- RQ4在小型真实世界植物数据集上,该方法是否在语义分割任务中优于标准增强和无增强方法?
主要发现
- 在 IPPN 数据集上进行语义分割任务时,所提出的增强方法相比标准增强技术实现了 9% 的相对 F1 分数提升。
- 与无任何数据增强训练相比,F1 分数相对提升了 12%,表明合成数据带来了显著的性能增益。
- 在增强数据上训练的模型仅用 20 个周期即达到最优性能,且采用更高的初始学习率(0.001),表明收敛速度更快。
- 该框架成功生成了包含重叠对象、噪声和模糊效果的多样化、逼真的场景,实现了从极少输入样本中进行多任务学习。
- 内存估算表明,该方法在实时设置中仍具可行性,且内存使用量随场景复杂度线性增长。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。