[论文解读] Consensus-based Sequence Training for Video Captioning
该论文提出了一种基于共识的序列训练(CST),这是一种两阶段方法:首先通过加权交叉熵预训练步骤,将真实字幕视为模型样本,以减少目标不匹配问题;随后使用 REINFORCE 算法进行微调,以真实字幕之间的共识得分作为快速且稳定的基线。CST 在 MSRVTT 数据集上实现了 54.2 的新 SOTA CIDEr 分数,较之前方法高出超过 2.9 分。
Captioning models are typically trained using the cross-entropy loss. However, their performance is evaluated on other metrics designed to better correlate with human assessments. Recently, it has been shown that reinforcement learning (RL) can directly optimize these metrics in tasks such as captioning. However, this is computationally costly and requires specifying a baseline reward at each step to make training converge. We propose a fast approach to optimize one's objective of interest through the REINFORCE algorithm. First we show that, by replacing model samples with ground-truth sentences, RL training can be seen as a form of weighted cross-entropy loss, giving a fast, RL-based pre-training algorithm. Second, we propose to use the consensus among ground-truth captions of the same video as the baseline reward. This can be computed very efficiently. We call the complete proposal Consensus-based Sequence Training (CST). Applied to the MSRVTT video captioning benchmark, our proposals train significantly faster than comparable methods and establish a new state-of-the-art on the task, improving the CIDEr score from 47.3 to 54.2.
研究动机与目标
- 为解决视频字幕生成中的目标不匹配问题,即交叉熵训练与人类评估指标(如 CIDEr)不一致的问题。
- 通过用基于共识的奖励替代贪婪基线估计,降低强化学习方法在字幕生成中的训练不稳定性与计算成本。
- 在微调前实现高效且稳定的预训练,以提升泛化能力,同时将目标不匹配与暴露偏差问题分离。
- 通过直接优化基于共识的指标(如 CIDEr),在 MSRVTT 基准上建立新的 SOTA 性能。
提出的方法
- 提出一种加权交叉熵预训练方案(WXE),将真实字幕视为模型样本,从而有效近似使用真实标签的 REINFORCE 算法。
- 引入自一致性基线(SCB),通过计算某一视频所有真实字幕之间的平均 CIDEr 得分,作为 REINFORCE 中的基线奖励。
- 利用 SCB 加速训练,避免在基线估计过程中重复进行贪婪采样,相比贪婪基线,训练时间减少约 2 倍。
- 采用两阶段训练流程:首先进行 WXE 预训练以缓解目标不匹配问题,随后使用 SCB 进行完整的 REINFORCE 微调,以应对暴露偏差问题。
- 采用 REINFORCE 算法并引入基线以稳定策略梯度估计,使用 CIDEr 作为奖励信号,以优化生成更符合人类偏好的字幕。
- 将方法扩展至训练过程中使用采样字幕计算 SCB,从而在保持计算效率的同时支持动态基线估计。
实验结果
研究问题
- RQ1在 REINFORCE 训练中,是否可用真实字幕替代模型生成样本,从而实现稳定且快速的预训练,有效缓解目标不匹配问题?
- RQ2在 REINFORCE 训练中,使用真实字幕之间的共识得分作为基线,是否能实现比贪婪基线估计更快的收敛速度和更高的性能?
- RQ3两阶段训练方案(即加权交叉熵预训练 + 基于共识的 REINFORCE 微调)是否能同时缓解目标不匹配与暴露偏差问题?
- RQ4所提出的基于共识的序列训练(CST)方法在优化 CIDEr 指标时,是否能在 MSRVTT 视频字幕基准上实现 SOTA 性能?
主要发现
- CST 在 MSRVTT 基准上实现了 54.2 的新 SOTA CIDEr 分数,显著优于此前最佳得分 51.7。
- 仅 WXE 预训练阶段相比标准交叉熵训练,CIDEr 分数提升超过 2 分(从 47.3 提升至 49.7)。
- 使用自一致性基线(SCB)进行微调,性能进一步提升 3.9 分,达到 53.6;通过引入采样字幕进行进一步优化,最终达到 54.2。
- 由于避免了对贪婪输出重复计算 CIDEr,SCB 基线使训练速度相比贪婪基线提升约 2 倍。
- CST 在所有指标上均优于所有先前方法,其中在 CIDEr 指标上的提升最大,该指标与人类判断的相关性最强。
- 定性分析表明,CST 生成的字幕更具一致性和人类自然性,尤其在人类标注字幕差异较大的视频上表现更优,归因于对异常值的敏感性降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。