Skip to main content
QUICK REVIEW

[论文解读] Effects of Word-frequency based Pre- and Post- Processings for Audio Captioning

Daiki Takeuchi, Yuma Koizumi|arXiv (Cornell University)|Sep 24, 2020
Subtitles and Audiovisual Media参考文献 29被引用 11
一句话总结

本文研究了在自动音频字幕生成中基于词频的预处理和后处理技术的影响,提出了一种结合混合数据增强和束搜索解码的系统。结果表明,这些方法分别使SPIDEr提升0.8分和1.6分,而多任务学习在零样本训练条件下未见收益。

ABSTRACT

The system we used for Task 6 (Automated Audio Captioning)of the Detection and Classification of Acoustic Scenes and Events(DCASE) 2020 Challenge combines three elements, namely, dataaugmentation, multi-task learning, and post-processing, for audiocaptioning. The system received the highest evaluation scores, butwhich of the individual elements most fully contributed to its perfor-mance has not yet been clarified. Here, to asses their contributions,we first conducted an element-wise ablation study on our systemto estimate to what extent each element is effective. We then con-ducted a detailed module-wise ablation study to further clarify thekey processing modules for improving accuracy. The results showthat data augmentation and post-processing significantly improvethe score in our system. In particular, mix-up data augmentationand beam search in post-processing improve SPIDEr by 0.8 and 1.6points, respectively.

研究动机与目标

  • 澄清在DCASE 2020挑战赛中高性能音频字幕系统中,各组件(数据增强、多任务学习、后处理)的贡献。
  • 探究在数据量有限、无预训练的条件下,数据增强和后处理是否能提升字幕生成的准确性。
  • 确定在从零开始训练时,针对句子长度和关键词预测的多任务学习是否能提升性能。
  • 评估束搜索解码和推理时增强在提升字幕质量指标方面的有效性。

提出的方法

  • 通过线性组合训练样本,应用混合数据增强生成合成的音频-字幕对。
  • 采用基于TF-IDF的词位置分配和基于IDF的样本选择方法进行数据增强,以提升训练多样性。
  • 实施多任务学习框架,采用共享编码器和分别用于预测句子长度和关键词的分支头。
  • 在推理阶段采用束搜索解码,从多个候选序列中选择似然度最高的字幕序列。
  • 通过从每个音频样本中裁剪多个20秒片段进行推理平均,应用推理时增强(TTA)。
  • 在元素级和模块级均进行消融研究,以隔离各组件的贡献。

实验结果

研究问题

  • RQ1在训练数据有限的条件下,混合数据增强在提升音频字幕性能方面的有效性如何?
  • RQ2与贪婪解码相比,束搜索解码在多大程度上提升了字幕质量?
  • RQ3在从零开始训练时,针对句子长度和关键词预测的多任务学习是否能提升字幕生成准确性?
  • RQ4基于IDF的样本选择和TTA在多大程度上影响了模型的泛化能力和性能?
  • RQ5在数据增强、多任务学习和后处理中,哪个组件对最终模型性能的提升最为显著?

主要发现

  • 混合数据增强使SPIDEr提升了0.8分,证明其在低资源音频字幕任务中的有效性。
  • 束搜索解码使CIDEr和BLEU-4得分在SPIDEr上分别提升了1.6分,表明其在提升整句连贯性方面效果显著。
  • 在零样本训练条件下,多任务学习未提升性能,表明此类模块可能需要预训练才能发挥作用。
  • TTA和基于IDF的样本选择未提升性能,可能是因为增强样本的统计分布变化极小。
  • 数据增强与后处理的结合带来了独立且叠加的增益,当两者均被移除时,SPIDEr下降了3.2分。
  • 束搜索解码在基于n-gram的指标上尤为有效,因其选择的是全局最优序列,而非局部最优的词选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。