[论文解读] Material Classification in the Wild: Do Synthesized Training Data Generalise Better than Real-World Training Data?
本文研究了在非受限环境中,合成训练数据相较于真实世界数据在材料分类任务中是否具有更好的泛化能力。基于在三个真实世界材料数据集上预训练的卷积神经网络(CNN),研究结果表明,使用合成数据可使平均平均精度(mAP)提升5%至19%,在跨数据集评估中最高达到91.03%,表明其在泛化能力上优于真实数据。
We question the dominant role of real-world training images in the field of material classification by investigating whether synthesized data can generalise more effectively than real-world data. Experimental results on three challenging real-world material databases show that the best performing pre-trained convolutional neural network (CNN) architectures can achieve up to 91.03% mean average precision when classifying materials in cross-dataset scenarios. We demonstrate that synthesized data achieve an improvement on mean average precision when used as training data and in conjunction with pre-trained CNN architectures, which spans from ~ 5% to ~ 19% across three widely used material databases of real-world images.
研究动机与目标
- 挑战在非受限环境中真实世界训练数据优于材料分类任务的假设。
- 评估合成数据在材料识别任务中是否比真实世界数据具有更好的泛化能力。
- 评估在真实世界材料数据库上微调后,预训练CNN在合成数据上的性能表现。
- 在跨数据集评估设置下,比较三种广泛使用的现实世界材料数据集之间的泛化性能。
提出的方法
- 在受控条件下生成的合成材料数据上训练预训练的卷积神经网络(CNN)架构。
- 在跨数据集设置下,于三个真实世界材料数据库上评估模型性能,以衡量泛化能力。
- 使用平均平均精度(mAP)作为主要指标,比较在真实数据与合成数据上训练的模型之间的性能差异。
- 应用数据增强和领域随机化技术,以提升合成训练样本的多样性和真实性。
- 在合成数据上微调ImageNet预训练的CNN,然后在真实世界测试集上进行测试。
- 开展消融研究,评估数据来源(真实 vs. 合成)对模型泛化能力的影响。
实验结果
研究问题
- RQ1在材料分类任务中,合成训练数据是否能比真实世界训练数据具有更好的泛化能力?
- RQ2当在不同真实世界材料数据库上分别使用合成数据与真实世界数据进行训练时,模型性能如何变化?
- RQ3在跨数据集材料分类场景中,使用合成数据能在多大程度上提升平均平均精度?
- RQ4结合使用预训练CNN是否能增强与合成训练数据结合时的泛化能力?
主要发现
- 与真实世界数据相比,合成训练数据在三个评估的真实世界材料数据库上,平均平均精度(mAP)最高提升了19%。
- 在合成数据上训练的最佳模型在跨数据集材料分类任务中实现了91.03%的平均平均精度。
- 合成数据带来的mAP提升在所有三个真实世界材料数据集中均保持一致,提升幅度在5%至19%之间。
- 在跨数据集评估中,经过合成数据微调的预训练CNN比经过真实世界数据微调的模型泛化能力更强。
- 结果表明,合成数据在非受限环境中训练鲁棒材料分类模型方面,可能比真实世界数据更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。