[论文解读] NELS -- Never-Ending Learner of Sounds
NELS 提出了一种连续的、可扩展的网络系统,通过挖掘 YouTube 音频和元数据来学习声音与语言的关联,利用自监督学习和人工反馈提升声音识别性能。该系统在无真实标签的大规模评估中实现了稳定的性能提升,使用搜索查询作为人工评估的代理。
Sounds are essential to how humans perceive and interact with the world and are captured in recordings and shared on the Internet on a minute-by-minute basis. These recordings, which are predominantly videos, constitute the largest archive of sounds we know. However, most of these recordings have undescribed content making necessary methods for automatic sound analysis, indexing and retrieval. These methods have to address multiple challenges, such as the relation between sounds and language, numerous and diverse sound classes, and large-scale evaluation. We propose a system that continuously learns from the web relations between sounds and language, improves sound recognition models over time and evaluates its learning competency in the large-scale without references. We introduce the Never-Ending Learner of Sounds (NELS), a project for continuously learning of sounds and their associated knowledge, available on line in nels.cs.cmu.edu
研究动机与目标
- 解决缺乏大规模、持续学习声音的系统,该系统能随时间利用网络音频进行自适应学习。
- 通过半监督方式结合精选数据集和未精选的网络音频,提升声音识别的鲁棒性。
- 开发在无真实标签情况下的可扩展声音识别评估方法。
- 探索语言与声音之间的关系,包括形容词-名词和动词-名词对在声音描述中的应用。
- 为研究和应用创建一个公开可用、持续更新的音频索引与检索系统。
提出的方法
- NELS 使用声音事件标签作为搜索查询,持续爬取 YouTube,通过组合关键词如‘<sound> sound’来提高检索的相关性。
- 通过 Pafy API 提取元数据(标题、描述、URL),并利用这些信息对 2.3 秒长的音频片段进行索引。
- 声音识别模型在精选数据集(如 US8K)和网络音频的混合数据上进行训练,并通过自训练提升性能。
- 通过 NELS 网站收集人工反馈,以评估索引的正确性并指导模型优化。
- 使用搜索查询结果作为弱参考进行性能评估,假设相关查询反映了真实的声音内容。
- 系统使用依存路径特征和基于规则的分类器,从文本中发现声音描述词和本体关系。
实验结果
研究问题
- RQ1系统能否在持续学习未精选网络音频的同时,随时间推移不断提升性能?
- RQ2搜索查询(如‘air conditioner sound’)在评估声音识别时,作为人工标注真实标签的代理,其有效性如何?
- RQ3形容词-名词和动词-名词对在多大程度上能可靠地描述声音事件之间的声学差异?
- RQ4当训练数据和测试数据分布不一致时,如何利用网络音频的自监督学习来提升识别性能?
- RQ5能否利用‘sound of X’这类语言线索,在大规模上自动发现有效的声音事件标签?
主要发现
- 截至 2017 年 10 月 20 日,NELS 使用 600 个声音事件标签,已索引超过 300 小时的音频(400 万个视频片段)。
- 尽管存在数据分布差异,系统在使用 20 万个未标注 YouTube 片段重新训练后,整体精确率提升了 1.4% 的绝对值。
- 以搜索查询作为参考的性能趋势与人工反馈的差异在 10% 以内,表明查询可作为评估的下限指标。
- 通过‘sound of <Y>’模式和基于规则的过滤,发现了超过 10 万个有效的声音事件短语。
- 形容词-名词和动词-名词对在不同声音事件中表现出一致的、尽管主观的声学内容关联。
- 该系统证明了无需依赖精选真实标签数据,即可实现大规模、持续学习声音知识的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。