[论文解读] Audio Captioning Using Sound Event Detection
该论文提出了一种音频字幕模型,通过整合声音事件检测与预训练音频特征(PANNs)及Word2Vec嵌入,提升了字幕质量。采用基于BiGRU的编码器-解码器架构,将PANN特征与检测到的声音事件进行拼接,该方法在Clotho V2数据集上的所有指标中均显著优于基线模型,CIDEr和SPIDEr得分提升超过40%。
This technical report proposes an audio captioning system for DCASE 2021 Task 6 audio captioning challenge. Our proposed model is based on an encoder-decoder architecture with bi-directional Gated Recurrent Units (BiGRU) using pretrained audio features and sound event detection. A pretrained neural network (PANN) is used to extract audio features and Word2Vec is selected with the aim of extracting word embeddings from the audio captions. To create semantically meaningful captions, we extract sound events from the audio clips and feed the encoder-decoder architecture with sound events in addition to PANNs features. Our experiments on the Clotho dataset show that our proposed method significantly achieves better results than the challenge baseline model across all evaluation metrics.
研究动机与目标
- 通过引入超越原始音频特征的语义丰富的声音事件信息,提升音频字幕性能。
- 解决现有音频字幕模型无法捕捉事件、场景与物体之间上下文关系的局限性。
- 探索将预训练音频嵌入(PANNs)与声音事件检测相结合在生成更描述性、更准确字幕方面的有效性。
- 在多个自动评估指标上超越DCASE 2021 Task 6基线模型。
提出的方法
- 系统使用PANNs(Wavegram-Logmel-CNN14)模型从96ms汉明窗加权、50%重叠的频谱图中提取2048维音频特征。
- 通过设定阈值(0.1)对PANNs最后一层的概率进行处理,检测声音事件,每帧时间得到527类事件的概率。
- 将检测到的事件分词为词级别组件(例如,'Scary Music' → ['Scary', 'Music']),以提升语义相似度与嵌入对齐效果。
- 通过独热编码将检测到的事件转换为二值向量,并与PANN特征拼接后作为编码器的输入。
- 编码器使用两层BiGRU(32和64个单元)处理音频特征与事件向量,同时使用另一独立的GRU(128个单元)编码部分字幕。
- Word2Vec嵌入(256维)表示字幕中的词,编码后的字幕与音频及事件特征拼接后,通过一个128单元的GRU进行解码,输出采用softmax激活。
实验结果
研究问题
- RQ1整合检测到的声音事件是否能提升音频字幕的语义质量与准确性?
- RQ2与仅使用音频特征相比,PANNs特征与声音事件向量的融合对字幕性能有何影响?
- RQ3在音频字幕背景下,使用Word2Vec嵌入在多大程度上提升了字幕生成质量?
- RQ4所提出的模型是否在多个标准评估指标上均优于DCASE 2021基线模型?
主要发现
- 所提模型的CIDEr得分为0.328,较Clotho V2基线(0.075)提升335%,表明与参考字幕的语义对齐性显著增强。
- 模型的SPIDEr得分为0.242,较基线(0.051)提升375%,表明在基于场景图的字幕评估中表现更优。
- BLEU-1得分从基线的0.378提升至0.586,表明生成字幕的n-gram精确度更强。
- 模型的METEOR得分为0.214,较基线(0.078)提升174%,表明字幕匹配的召回率与精确度更高。
- ROUGE-L得分为0.444,较基线(0.263)提升68.8%,反映出更优的最长公共子序列对齐能力。
- 结果表明,所有指标均实现一致且显著的提升,证实声音事件检测可增强字幕的语义丰富度与整体质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。