[论文解读] Zero-Shot Video Captioning with Evolving Pseudo-Tokens
该论文提出了一种零样本视频字幕生成方法,通过在冻结的GPT-2与CLIP框架内对可学习伪标记进行迭代优化,生成连贯且富含知识的字幕。通过迭代优化提示以最大化CLIP匹配分数,同时保持语言流畅性,该方法在无需微调的情况下生成越来越具体和有依据的字幕,其在流畅性和事实依据性方面优于当前最先进的零样本方法。
We introduce a zero-shot video captioning method that employs two frozen networks: the GPT-2 language model and the CLIP image-text matching model. The matching score is used to steer the language model toward generating a sentence that has a high average matching score to a subset of the video frames. Unlike zero-shot image captioning methods, our work considers the entire sentence at once. This is achieved by optimizing, during the generation process, part of the prompt from scratch, by modifying the representation of all other tokens in the prompt, and by repeating the process iteratively, gradually improving the specificity and comprehensiveness of the generated sentence. Our experiments show that the generated captions are coherent and display a broad range of real-world knowledge. Our code is available at: https://github.com/YoadTew/zero-shot-video-to-text
研究动机与目标
- 为解决缺乏大规模高质量人工标注数据集背景下的视频字幕生成挑战。
- 在无需微调的前提下实现零样本视频字幕生成,利用预训练模型生成流畅且有依据的描述。
- 通过新颖的迭代提示优化过程,一次性优化整个句子而非单个标记,以提升字幕质量。
- 使模型能够从稀疏的视频帧中整合现实世界知识与叙事结构。
提出的方法
- 该方法使用两个冻结模型:GPT-2用于自回归文本生成,CLIP用于图文匹配以指导字幕质量。
- 提示由三部分构成:语言模型潜在空间中的可学习伪标记、随机上下文提示(例如“一张……的照片”)以及先前生成的标记。
- 在自回归生成过程中,通过对比损失在内存中优化伪标记,以最大化生成句子的平均CLIP匹配分数。
- 优化过程迭代重复——最多16次——以前一次迭代中优化后的伪标记作为新起点,从而生成越来越具体和有依据的字幕。
- 该过程通过正则化语言模型,避免下一项标记概率的剧烈变化,从而在提升与输入帧对齐性的同时保持流畅性。
- 最终字幕选择为在所有迭代中获得最高CLIP匹配分数的版本。
实验结果
研究问题
- RQ1一种零样本视频字幕生成方法是否能在不依赖标注数据微调的情况下,生成连贯且富含知识的字幕?
- RQ2通过迭代提示优化实现整个句子的优化,是否相比逐标记优化能显著提升字幕质量?
- RQ3基于GPT-2与CLIP等冻结模型的方法,能否从稀疏视频帧中生成反映逻辑事件顺序与现实世界知识的叙事性描述?
- RQ4与基线零样本方法相比,伪标记的迭代优化如何影响字幕的依据性与流畅性?
主要发现
- 所提方法在视频字幕任务中的人工评估得分为4.14(满分5分),显著优于次佳方法(2.30),证明其在流畅性与事实依据性方面表现更优。
- 在图像字幕任务中,该方法的人工评估得分为4.01,而次佳方法为2.52,表明其在视觉输入上具有强大的泛化能力。
- 模型生成的字幕在迭代过程中逐渐提升具体性:从抽象概念(如“士兵”、“战斗”)演变为具体实体(如“光环角色”),最终发展为叙事语境(如“动画卡通”)。
- 在一个视频示例中,CLIP匹配分数从0.70提升至0.88(16次迭代后),表明与输入帧的对齐性显著增强。
- 尽管MAGIC在微调的监督指标上表现更优,但该方法在流畅性与连贯性方面优于基于标记级优化的基线方法(如ZeroCap、MAGIC),这一结果由困惑度(PP)指标验证。
- 在随机图像集合上的压力测试表明,即使输入图像语义无关,模型仍能生成连贯且具有叙事性的描述,凸显其在合成推理与叙事构建方面的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。