[论文解读] ACGAN-based Data Augmentation Integrated with Long-term Scalogram for Acoustic Scene Classification
本文提出了一种结合长时频谱图特征的ACGAN-based数据增强框架,用于声学场景分类(ASC),显著提升了模型的泛化能力和准确率。通过利用基于小波的长时频域表征以及迭代优化滤波的GAN生成样本,该方法在DCASE2019挑战赛中以85.16%的准确率夺得第一名,测试集为fold-1。
In acoustic scene classification (ASC), acoustic features play a crucial role in the extraction of scene information, which can be stored over different time scales. Moreover, the limited size of the dataset may lead to a biased model with a poor performance for records from unseen cities and confusing scene classes. In order to overcome this, we propose a long-term wavelet feature that requires a lower storage capacity and can be classified faster and more accurately compared with classic Mel filter bank coefficients (FBank). This feature can be extracted with predefined wavelet scales similar to the FBank. Furthermore, a novel data augmentation scheme based on generative adversarial neural networks with auxiliary classifiers (ACGANs) is adopted to improve the generalization of the ASC systems. The scheme, which contains ACGANs and a sample filter, extends the database iteratively by splitting the dataset, training the ACGANs and subsequently filtering samples. Experiments were conducted on datasets from the Detection and Classification of Acoustic Scenes and Events (DCASE) challenges. The results on the DCASE19 dataset demonstrate the improved performance of the proposed techniques compared with the classic FBank classifier. Moreover, the proposed fusion system achieved first place in the DCASE19 competition and surpassed the top accuracies on the DCASE17 dataset.
研究动机与目标
- 为解决ASC模型在未见城市及易混淆场景类别上因小样本、类别不平衡数据集导致的泛化能力有限问题。
- 开发一种基于长时小波的特征(频谱图),以比短时FBank特征更有效地捕捉多尺度声学线索。
- 设计一种迭代式ACGAN-based数据增强方案,并引入样本筛选机制,以生成多样化、高质量的合成音频样本。
- 通过对抗训练和基于DCT的时序建模模块,提升模型鲁棒性。
- 通过特征融合与系统集成,在DCASE基准数据集上实现最先进性能。
提出的方法
- 通过预设的小波尺度作用于STFT谱图,提取长时频谱图,替代传统的FBank特征。
- 采用基于ACGAN的数据增强方案,其中生成器在类别标签条件下的控制下生成合成音频样本。
- 按城市对数据集进行划分,以实现对已见城市的训练和对未见城市的评估,从而提升泛化能力。
- 在每次ACGAN训练迭代后应用样本筛选机制,以选择高质量的合成样本,确保在迭代扩展过程中保持数据质量。
- 该框架集成了对抗训练与基于DCT的时序模块,以增强特征表示并减少过拟合。
- 通过平均投票法融合多个分类器(DCNNs、FCNNs),并确定了频谱图与FBank特征的最佳融合比例(1:2)。
实验结果
研究问题
- RQ1基于小波变换提取的长时频谱图特征是否能在捕捉多尺度声学场景线索方面优于短时FBank特征?
- RQ2结合样本筛选的ACGAN-based数据增强方法是否能提升ASC在未见城市及易混淆场景类别上的泛化能力?
- RQ3对抗训练与基于DCT的时序建模的结合如何影响模型的鲁棒性与性能?
- RQ4在ASC系统中,长时频谱图与短时FBank特征之间最优的融合策略是什么?
- RQ5所提出的框架是否能在DCASE基准数据集上实现最先进性能?
主要发现
- 所提出的长时频谱图特征在捕捉节奏性和持续性环境声学线索方面优于FBank特征,准确率更高。
- 结合迭代筛选机制的ACGAN-based数据增强方案显著提升了模型在未见城市录音上的泛化能力。
- 在1:2融合比例下,频谱图与FBank特征的融合取得了最佳性能,在DCASE2019 fold-1测试集上达到85.16%的准确率。
- 在特征融合后,系统在DCASE17上的准确率达到84.57%,较当时最优方法高出1.3%。
- 对抗训练与基于DCT的时序模块有效降低了训练损失,但需谨慎调参以避免过拟合。
- 该方法在DCASE2019挑战赛中获得第一名,充分证明了其在多样化声学场景下的强泛化能力与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。