Skip to main content
QUICK REVIEW

[论文解读] The NTT DCASE2020 Challenge Task 6 system: Automated Audio Captioning with Keywords and Sentence Length Estimation

Yuma Koizumi, Daiki Takeuchi|arXiv (Cornell University)|Jul 1, 2020
Music and Audio Processing参考文献 15被引用 21
一句话总结

本论文提出了一种用于自动音频字幕生成的多任务学习系统,通过联合估计关键词和句子长度来解决词汇选择和句子长度的不确定性问题。该模型通过将关键词和长度预测整合到带有注意力机制和数据增强的序列到序列字幕生成框架中,在 DCASE2020 开发测试集上取得了 20.7 的 SPIDEr 得分,显著优于基线模型(5.4)。

ABSTRACT

This technical report describes the system participating to the Detection and Classification of Acoustic Scenes and Events (DCASE) 2020 Challenge, Task 6: automated audio captioning. Our submission focuses on solving two indeterminacy problems in automated audio captioning: word selection indeterminacy and sentence length indeterminacy. We simultaneously solve the main caption generation and sub indeterminacy problems by estimating keywords and sentence length through multi-task learning. We tested a simplified model of our submission using the development-testing dataset. Our model achieved 20.7 SPIDEr score where that of the baseline system was 5.4.

研究动机与目标

  • 解决音频字幕生成中的词汇选择不确定性问题,即单一声学事件可用多个同义词描述。
  • 缓解句子长度不确定性问题,即同一事件可被简洁或详细地描述。
  • 通过共享的深度学习架构同时估计关键词和句子长度,以提升字幕生成质量。
  • 利用基于 TF-IDF 的数据采样和增强方法,提升模型对低频词汇和罕见主题的泛化能力。
  • 通过专用子模型的集成,实现在 DCASE2020 音频字幕基准上的最先进性能。

提出的方法

  • 从原始音频中提取对数梅尔频谱图,并应用 HPSS 方法分离谐波与打击乐成分,将两者拼接为三通道输入张量。
  • 使用 NLTK 分词对字幕进行预处理,并构建包含 2,144 个词的词汇表,包括 BOS、EOS、PAD 和 UNK 标记。
  • 从文件名和元数据中提取 421 个词干化后的关键词,用于提取元数据关键词和字幕关键词。
  • 设计了一个多任务序列到序列模型,共享编码器及用于字幕生成、关键词估计和句子长度预测的解码器。
  • 采用基于 TF-IDF 的采样策略,优先选择包含罕见词汇和主题的训练样本,以提升对低频术语的泛化能力。
  • 使用 AdamW 优化器以恒定的 1e-4 学习率进行训练,基于验证损失进行早停,并在推理阶段采用模型集成。

实验结果

研究问题

  • RQ1联合估计关键词和句子长度是否能有效减少音频字幕生成中的词汇选择和句子长度不确定性?
  • RQ2在引入关键词和长度等辅助预测任务时,多任务学习在提升字幕生成性能方面的有效性如何?
  • RQ3基于 TF-IDF 的数据采样在多大程度上提升了模型对字幕任务中罕见词汇和主题的性能表现?
  • RQ4架构变化(如用全连接层替代多头自注意力机制,或移除元关键词分支)对模型性能有何影响?
  • RQ5在低资源、高不确定性设置(如音频字幕)下,模型集成对最终字幕生成性能有何影响?

主要发现

  • 所提出的系统在 DCASE2020 开发测试数据集上取得了 20.7 的 SPIDEr 得分,远超基线系统(5.4)的性能表现。
  • 所有独立模型变体(Model1–Model6)均优于基线模型,证明了多任务学习方法的有效性。
  • 结合多个专用架构(如 Model1、Model3、Model4、Model5、Model6)的集成模型达到了最高性能。
  • 采用基于 TF-IDF 的数据采样与增强方法提升了模型对罕见词汇和主题的鲁棒性,有助于获得更高的 SPIDEr 得分。
  • 对元关键词估计和注意力模块的消融实验(Model3)仍表现出强劲性能,表明核心字幕生成和预测头已足够实现高精度。
  • 模型集成方法,特别是包含 50 个模型的 Submission 2,展现出高度的稳定性和性能,表明模型架构的多样性有助于提升泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。