[论文解读] A Data-Centric Approach for Training Deep Neural Networks with Less Data
本文提出一种以数据为中心的方法,通过自动化检测重复样本和错误标注样本,提升数据集质量,并利用基于生成对抗网络(GAN)的方法合成难以分类的样本,从而在有限数据下训练深度神经网络。该方法在罗马数字MNIST数据集上将准确率提升5%,同时将训练数据量减少34%,并通过生成合成数据进一步提升性能。
While the availability of large datasets is perceived to be a key requirement for training deep neural networks, it is possible to train such models with relatively little data. However, compensating for the absence of large datasets demands a series of actions to enhance the quality of the existing samples and to generate new ones. This paper summarizes our winning submission to the "Data-Centric AI" competition. We discuss some of the challenges that arise while training with a small dataset, offer a principled approach for systematic data quality enhancement, and propose a GAN-based solution for synthesizing new data points. Our evaluations indicate that the dataset generated by the proposed pipeline offers 5% accuracy improvement while being significantly smaller than the baseline.
研究动机与目标
- 为解决在缺乏大规模数据集的情况下有效训练深度神经网络的挑战,特别是在工业缺陷检测等数据受限领域。
- 通过系统性提升数据质量,检测并移除重复样本,识别错误标注或模糊样本,并通过人机协同反馈进行验证。
- 利用结合判别器和分类器反馈的GAN,生成多样化且难以分类的合成样本,以提升模型泛化能力。
- 证明数据质量优化与有针对性的数据合成可在训练数据有限的情况下显著提升模型准确率。
提出的方法
- 采用多阶段哈希流水线检测并消除重复样本,确保训练集与验证集之间无重叠。
- 在经人工验证的小型子集上训练辅助分类器,并结合大量数据增强技术(旋转、对比度调整、平移、噪声添加及虚线处理)以评估样本置信度。
- 根据辅助模型的损失对样本进行排序,将损失最高的K个(有效)样本与最低的L个(可疑)样本交由人工主管审查,以优化标签与数据质量。
- 训练GAN时采用联合损失函数:$ \text{Gen Loss} = \delta \times \text{BCE}(g_{\text{disc}}, y_{\text{disc}}) - \gamma \times \text{CCE}(g_{\text{class}}, y_{\text{class}}) $,其中$\delta=1$,$\gamma$线性增加至0.5。
- GAN生成的合成样本具有故意难以分类的特性,例如添加笔画噪声使' I '看起来像' II ',以提升模型鲁棒性。
- 通过辅助模型反馈与人工验证,迭代式地优化数据集,减少数据量的同时提升模型性能。
实验结果
研究问题
- RQ1在训练数据有限的情况下,系统性地提升数据质量是否能显著提高模型准确率?
- RQ2在小规模数据集中,结合辅助模型的人机协同方法在识别和纠正错误标注或模糊样本方面有多高效?
- RQ3通过分类器和判别器反馈训练的GAN能否生成有助于提升小规模真实世界数据集泛化能力的合成样本?
- RQ4在保持或提升模型准确率的前提下,数据合成能在多大程度上减少所需训练数据集的规模?
主要发现
- 优化后的数据集将训练样本量减少34%(从2067降至1370个),同时测试准确率从64%提升至69%,实现5%的性能增益。
- 该流水线在第一轮迭代中达到92%的人工验证准确率,第五轮时提升至89%,表明数据质量持续得到优化。
- 额外增加8,229个真实样本后,测试准确率提升至83%,证明了在基线之外继续收集真实数据的价值。
- 通过所提GAN生成1,226个新样本后,测试准确率进一步提升至84%,表明合成数据能有效增强模型鲁棒性。
- 最终在优化与合成数据集上训练的模型在训练集上达到100%准确率,验证集上达到92%准确率,表明其具有强大的泛化能力。
- GAN生成的样本在视觉上具有挑战性,例如在' I '上添加笔画噪声使其看起来像' II ',表明该方法对困难样本的增强效果显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。