[论文解读] Title Generation for User Generated Videos
本文将视频标题生成作为一个与视频字幕不同的新任务提出,提出两种方法以提升标题质量:强调敏感字幕模型,联合定位关键事件并生成简洁、注意力聚焦的标题;以及使用虚拟视频嵌入进行句子增强,以提升语言多样性。该方法在新收集的VTW数据集上达到最先进性能,人工评估显示59.5%的生成标题优于基线模型。
A great video title describes the most salient event compactly and captures the viewer's attention. In contrast, video captioning tends to generate sentences that describe the video as a whole. Although generating a video title automatically is a very useful task, it is much less addressed than video captioning. We address video title generation for the first time by proposing two methods that extend state-of-the-art video captioners to this new task. First, we make video captioners highlight sensitive by priming them with a highlight detector. Our framework allows for jointly training a model for title generation and video highlight localization. Second, we induce high sentence diversity in video captioners, so that the generated titles are also diverse and catchy. This means that a large number of sentences might be required to learn the sentence structure of titles. Hence, we propose a novel sentence augmentation method to train a captioner with additional sentence-only examples that come without corresponding videos. We collected a large-scale Video Titles in the Wild (VTW) dataset of 18100 automatically crawled user-generated videos and titles. On VTW, our methods consistently improve title prediction accuracy, and achieve the best performance in both automatic and human evaluation. Finally, our sentence augmentation method also outperforms the baselines on the M-VAD dataset.
研究动机与目标
- 解决生成简洁、吸引注意力的视频标题而非完整视频描述的挑战。
- 使视频字幕模型能够聚焦于未剪辑用户生成视频中的显著事件(亮点)。
- 提升生成标题的语言多样性,以反映现实使用中的高度可变性。
- 开发一种仅使用句子示例而无需对应视频的训练方法,用于视频字幕模型。
- 构建并发布一个大规模、开放域的未剪辑用户生成视频数据集,包含标题,用于基准测试。
提出的方法
- 提出一种强调敏感字幕模型,联合训练视频字幕模型与亮点检测器,以定位未剪辑视频中的显著时刻。
- 使用受亮点监督增强的软注意力机制,确保标题描述关键事件而非一般视频内容。
- 提出一种使用‘虚拟视频观测’的句子增强技术,通过额外的仅句子数据训练字幕模型,提升语言模型多样性。
- 通过在训练期间将所有增强后的句子分配给单一虚拟视频嵌入,同时使用视频-标题对和仅句子示例进行训练。
- 利用网络爬取的句子作为额外训练数据,以模拟标题中多样的语言模式。
- 使用所提方法微调现有的视频字幕模型(S2VT 和 SA),使其适用于标题生成任务。
实验结果
研究问题
- RQ1视频字幕模型能否被调整以生成简洁、聚焦亮点的标题,而非完整的视频描述?
- RQ2如何训练模型以定位未剪辑视频中最显著的事件,并仅描述该时刻生成标题?
- RQ3通过仅使用无视频上下文的句子数据进行训练,能否提升视频标题的语言多样性?
- RQ4使用虚拟视频嵌入的句子增强方法是否能有效提升标题生成性能?
- RQ5所提方法能否泛化至除新VTW数据集外的其他视频描述数据集?
主要发现
- 强调敏感字幕模型(HL)在自动评估与人工评估中均优于基线字幕模型,在VTW数据集上分别取得24.9% CIDEr与6.2% METEOR的性能。
- 强调敏感性与基于网络的句子增强相结合(HL+Web Aug.)达到最佳性能,在S2VT上实现25.4% CIDEr与6.2% METEOR,在SA上实现25.1% CIDEr与5.7% METEOR。
- 人工评估显示,59.5%的全方法(HL+Web Aug.)生成标题被认为与基线持平或更优。
- 句子增强方法在M-VAD数据集上提升性能,达到7.1% METEOR,优于S2VT基线的6.7% METEOR。
- 亮点检测器的mAP在联合训练后从54.2%提升至58.3%,证实端到端优化的有效性。
- 即使无真实亮点标注,仅使用自动检测亮点训练的方法(HL-0)仍取得22.4% CIDEr,表明对弱监督具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。