[论文解读] An Encoder-Decoder Based Audio Captioning System With Transfer and Reinforcement Learning
本论文提出了一种基于CNN-Transformer的音频字幕生成系统,通过利用预训练音频模型(PANNs)的迁移学习以及在AudioCaps数据集上的领域内微调,并结合强化学习以优化CIDEr得分。该系统在DCASE 2021任务6中获得第三名,优于多数指标上的最先进集成模型,尽管强化学习引入了如“in the background”等冗余短语。
Automated audio captioning aims to use natural language to describe the content of audio data. This paper presents an audio captioning system with an encoder-decoder architecture, where the decoder predicts words based on audio features extracted by the encoder. To improve the proposed system, transfer learning from either an upstream audio-related task or a large in-domain dataset is introduced to mitigate the problem induced by data scarcity. Besides, evaluation metrics are incorporated into the optimization of the model with reinforcement learning, which helps address the problem of ``exposure bias'' induced by ``teacher forcing'' training strategy and the mismatch between the evaluation metrics and the loss function. The resulting system was ranked 3rd in DCASE 2021 Task 6. Ablation studies are carried out to investigate how much each element in the proposed system can contribute to final performance. The results show that the proposed techniques significantly improve the scores of the evaluation metrics, however, reinforcement learning may impact adversely on the quality of the generated captions.
研究动机与目标
- 通过从上游音频任务和领域内数据集应用迁移学习,解决音频字幕任务中的数据稀缺问题。
- 通过在模型优化中引入CIDEr作为强化学习的奖励信号,缓解训练损失与评估指标之间的不匹配问题。
- 探究强化学习在字幕质量上的影响,超越指标得分本身。
- 评估多模态迁移学习(音频与语言)相较于单模态预训练的有效性。
- 分析自动评估指标与人类判断在音频字幕任务中的差异。
提出的方法
- 系统使用一个10层的CNN编码器(基于PANNs)从音频输入中提取对数梅尔频谱图特征。
- 一个Transformer解码器基于编码器特征和先前生成的标记自回归地生成字幕。
- 通过预训练的PANNs编码器和在AudioCaps数据集上的微调来应用迁移学习,以改善音频与语言表征学习。
- 通过CIDEr作为奖励信号的强化学习来优化模型,直接对齐训练过程与评估指标。
- 采用策略梯度方法基于生成字幕的CIDEr得分来更新解码器参数。
- 消融研究对比了包含与不包含迁移学习和强化学习的模型,以分离各组件的贡献。
实验结果
研究问题
- RQ1与从零开始训练相比,基于PANNs和AudioCaps的预训练对音频字幕性能有何影响?
- RQ2强化学习在多大程度上提升了CIDEr和SPICE等自动评估指标?
- RQ3尽管指标得分提升,强化学习是否降低了生成字幕的流畅性与语义质量?
- RQ4在性能与鲁棒性方面,音频单模态与音频+语言联合预训练策略有何差异?
- RQ5为何强化学习会导致生成字幕中“in the background”等短语被过度使用?
主要发现
- 所提出的系统在DCASE 2021任务6中获得第三名,除BLEU-1外在所有指标上均优于最先进集成模型。
- 使用PANNs进行预训练显著提升了所有评估指标,证明了强大音频特征提取的重要性。
- 在AudioCaps上进行微调进一步提升了性能,证实了联合音频-语言迁移学习优于单模态预训练。
- 强化学习提升了所有评估指标,包括CIDEr、SPICE和CIDEr-D,但引入了语法错误和重复词汇。
- 强化学习后,765个生成字幕包含“in the background”,是未使用强化学习时的五倍,尽管仅302个真实标注字幕中包含该短语,表明存在指标驱动的过拟合。
- 结果表明,当前自动指标如CIDEr并未完全与人类判断对齐,因为指标得分提升的同时字幕质量反而下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。