Skip to main content
QUICK REVIEW

[论文解读] CLEAR: A Dataset for Compositional Language and Elementary Acoustic Reasoning

Jerome Abdelnour, Giampiero Salvi|arXiv (Cornell University)|Nov 26, 2018
Natural Language Processing Techniques参考文献 12被引用 7
一句话总结

本文提出 CLEAR,一个用于组合性声学问答(AQA)的合成数据集,其中模型需回答关于由基础声音组成的音频场景的问题。采用受 CLEVR 启发的数据生成框架,创建包含乐器声音的场景,并通过功能程序生成关于音量、明亮度、音高、时间关系及空间关系的问题,在 50,000 个场景的基准测试中,FiLM 模型达到 89.97% 的准确率。

ABSTRACT

We introduce the task of acoustic question answering (AQA) in the area of acoustic reasoning. In this task an agent learns to answer questions on the basis of acoustic context. In order to promote research in this area, we propose a data generation paradigm adapted from CLEVR (Johnson et al. 2017). We generate acoustic scenes by leveraging a bank elementary sounds. We also provide a number of functional programs that can be used to compose questions and answers that exploit the relationships between the attributes of the elementary sounds in each scene. We provide AQA datasets of various sizes as well as the data generation code. As a preliminary experiment to validate our data, we report the accuracy of current state of the art visual question answering models when they are applied to the AQA task without modifications. Although there is a plethora of question answering tasks based on text, image or video data, to our knowledge, we are the first to propose answering questions directly on audio streams. We hope this contribution will facilitate the development of research in the area.

研究动机与目标

  • 将声学问答(AQA)确立为人工智能领域的新任务,使模型能够对原始音频流进行推理,而非对转录语音进行处理。
  • 通过创建具有明确语义基础且受控偏差的合成数据集,解决当前缺乏支持音频组合性推理的数据集的问题。
  • 将原本用于视觉推理的 CLEVR 范式扩展至听觉模态,使用真实的音乐录音作为基础声音。
  • 通过结构化、可解释的问题与答案,实现对神经网络模型在基于音频推理任务上的评估。

提出的方法

  • 通过串联来自 Good-Sounds 数据库的真实乐器音符录音生成声学场景,以乐器、音高、音量和明亮度等属性表示基础声音。
  • 使用功能程序基于声音属性之间的关系及其在序列中的位置生成问题,确保语义一致性并减少标注偏差。
  • 将每个场景转换为固定分辨率的频谱图图像,以兼容基于视觉的模型(如 FiLM),随后对这些模型进行 AQA 任务微调。
  • 数据集包含六个版本,场景数量从 1,000 到 50,000 不等,每个场景包含 20 至 40 个问题,涵盖九类问题类型,包括是/否问题、音符识别、乐器查询和位置推理。
  • 在生成过程中设置验证流程,拒绝格式错误或退化的提问,确保仅包含结构良好且需要推理的问题。
  • 数据生成管道已开源,以促进可复现性与进一步开发。

实验结果

研究问题

  • RQ1能否通过频谱图表示,有效将训练于视觉问答(VQA)的模型迁移至原始音频流的推理任务?
  • RQ2在合成听觉环境中,对基础声音属性(如音高、音量、明亮度、时间)的组合性推理在多大程度上可被建模?
  • RQ3当不进行架构修改时,最先进 VQA 模型在纯音频推理任务上的性能如何迁移?
  • RQ4AQA 中的数据偏差有何影响?是否可通过类似 CLEVR 的功能程序生成方法加以缓解?
  • RQ5不同类型的音频关系(如相对位置、数量、绝对位置)如何影响模型在声学推理任务中的表现?

主要发现

  • FiLM 模型在包含 7,500 个场景和 300,000 个问答对的 CLEAR 测试集上达到 89.97% 的准确率,表明其在基于音频的推理任务中具备强大的泛化能力。
  • 多数类分类器的基线准确率仅为 7.6%,证实该任务具有挑战性,需真正推理而非模式匹配。
  • 基于功能程序的生成方法成功创建了多样化、语义明确的问题,这些问题需要对声音属性及其关系进行多步推理。
  • 该数据集支持九类不同的问题类型,包括是/否问题、音符识别、乐器查询和位置推理,支持对推理能力的细粒度评估。
  • 初步结果表明,当使用频谱图作为输入时,基于视觉的模型可有效重用于音频推理,提示跨模态迁移具有潜力。
  • 作者识别出若干关键局限性——固定长度场景、相等声音数量、无重叠声音以及有限的乐器类型——并计划在后续版本中加以改进,以提升真实感与复杂度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。