[论文解读] Finding the Right Moment: Human-Assisted Trailer Creation via Task Composition
本文提出了一种基于人类辅助的预告片生成框架,通过使用基于图的电影镜头模型,将任务分解为叙事结构识别与情感预测。通过联合对比学习利用剧本中的特权信息,该方法在人类评委评估中优于竞争性的监督方法,当引入关键转折点作为结构先验时性能最佳。
Movie trailers perform multiple functions: they introduce viewers to the story, convey the mood and artistic style of the film, and encourage audiences to see the movie. These diverse functions make trailer creation a challenging endeavor. In this work, we focus on finding trailer moments in a movie, i.e., shots that could be potentially included in a trailer. We decompose this task into two subtasks: narrative structure identification and sentiment prediction. We model movies as graphs, where nodes are shots and edges denote semantic relations between them. We learn these relations using joint contrastive training which distills rich textual information (e.g., characters, actions, situations) from screenplays. An unsupervised algorithm then traverses the graph and selects trailer moments from the movie that human judges prefer to ones selected by competitive supervised approaches. A main advantage of our algorithm is that it uses interpretable criteria, which allows us to deploy it in an interactive tool for trailer creation with a human in the loop. Our tool allows users to select trailer shots in under 30 minutes that are superior to fully automatic methods and comparable to (exclusive) manual selection by experts.
研究动机与目标
- 为解决自动电影预告片生成的挑战,该挑战需要理解叙事结构与情感流动。
- 将预告片生成分解为两个子任务:识别关键叙事转折点,以及预测镜头之间的情感强度。
- 通过在训练过程中利用剧本数据作为特权信息,提升模型性能,避免昂贵的视频级标注。
- 开发一种无监督的基于图的遍历算法,以生成连贯且受人类偏好的预告片。
- 通过人类对内容信息量和吸引力的判断,评估模型的有效性。
提出的方法
- 将电影建模为图结构,其中节点代表镜头,边代表由剧本标注事件推导出的语义关系。
- 训练一个双分支对比学习框架:一个使用剧本文本,另一个使用视频特征,通过对比损失实现共享表示学习。
- 利用剧本数据为节点标注转折点类型(例如:高潮、重大挫折),并为镜头分配情感得分。
- 在电影图上应用无监督的随机游走策略,以选择并排序镜头生成预告片提案。
- 将关键转折点作为结构先验引入,以指导遍历过程,提升连贯性与吸引力。
- 通过亚马逊机械 Turk 上的人工评估进行评测,采用最佳-最差评分法对预告片在信息量和吸引力方面进行排名。
实验结果
研究问题
- RQ1将预告片生成分解为叙事结构识别与情感预测是否能提升自动预告片的质量?
- RQ2通过对比学习利用剧本数据作为特权信息,是否能增强用于预告片生成的镜头级表征学习?
- RQ3将关键转折点作为结构先验,是否会影响生成预告片的连贯性与人类偏好?
- RQ4无监督的图遍历方法是否能优于监督基线模型,生成信息量更丰富且更具吸引力的预告片?
- RQ5生成的预告片在多大程度上包含剧透?避免剧透是否会降低质量?
主要发现
- 包含关键转折点的 GraphTrailer 在信息量(Q1)和吸引力(Q2)方面均获得最高的人类偏好,优于所有其他模型。
- 包含关键转折点的模型极少被评为最差,表明其质量稳定;而未使用关键转折点的模型则常被评为最佳与最差,表明其质量波动较大。
- 监督型 GraphTrailer 和无关键转折点的 GraphTrailer 分别有 24.40% 和 22.50% 的概率被评为最佳,但也常被评为最差,表明其质量方差较高。
- 使用剧本数据进行对比学习显著提升了模型性能,使无需视频级标注即可实现更优的镜头级表征学习。
- 尽管包含了最后两个关键转折点(重大挫折与高潮)的镜头,该模型并未产生过多剧透;在随机抽取的 12 个测试预告片中仅发现一个重大剧透。
- 在缺乏领域内数据的情况下,细粒度情感预测不可靠,因此本研究采用正/负情感作为情感强度的稳定代理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。