[论文解读] MPST: A Corpus of Movie Plot Synopses with Tags
本论文提出了MPST,一个大规模、多标签的语料库,包含14,828条电影剧情梗概,标注了71个细粒度、非冗余的标签,反映剧情属性,如类型、情感和叙事结构。作者通过多源方法收集并整理数据,利用情感流分析验证标签的相关性,并展示了使用传统语言学特征从剧情文本中预测标签的可行性,为未来自动电影标签化与叙事理解研究建立了基准。
Social tagging of movies reveals a wide range of heterogeneous information about movies, like the genre, plot structure, soundtracks, metadata, visual and emotional experiences. Such information can be valuable in building automatic systems to create tags for movies. Automatic tagging systems can help recommendation engines to improve the retrieval of similar movies as well as help viewers to know what to expect from a movie in advance. In this paper, we set out to the task of collecting a corpus of movie plot synopses and tags. We describe a methodology that enabled us to build a fine-grained set of around 70 tags exposing heterogeneous characteristics of movie plots and the multi-label associations of these tags with some 14K movie plot synopses. We investigate how these tags correlate with movies and the flow of emotions throughout different types of movies. Finally, we use this corpus to explore the feasibility of inferring tags from plot synopses. We expect the corpus will be useful in other tasks where analysis of narratives is relevant.
研究动机与目标
- 创建一个大规模、多标签的电影剧情梗概数据集,其标签细粒度且非冗余,反映剧情相关属性,如类型、情感和叙事结构。
- 通过从多个噪声源(如MovieLens、IMDb)聚合并整理,设计一个经过筛选、语义上明确区分的标签集,以解决现有标签空间中的噪声与冗余问题。
- 研究标签与电影剧情情感流之间的相关性,以验证标签分配的语义一致性。
- 评估使用传统语言学特征从剧情梗概中预测多标签的可行性,为未来叙事文本中的多标签分类任务建立基准。
- 提供一个免费获取的高质量语料库,以支持自动标签生成、推荐系统和叙事分析等研究。
提出的方法
- 通过从Wikipedia收集剧情梗概并利用IMDb ID将其与电影关联,构建了MPST语料库,确保与MovieLens 20M数据集中的标签分配一致。
- 通过迭代优化设计出包含71个标签的细粒度标签集,将语义相近的标签(如“cult”与“cult film”)合并为“cult”,以减少冗余并提升语义清晰度。
- 通过聚合MovieLens和IMDb的用户生成标签,将标签映射到电影,应用归一化与聚类技术以解决不一致性和噪声问题。
- 收集并预处理剧情梗概,确保长度与质量,最终每条梗概的平均长度为986.47个词,显著长于现有数据集(如MM-IMDb)。
- 使用从剧情文本中提取的传统语言学特征(如词性、情感倾向、命名实体)训练多标签分类基准模型,以预测标签分配。
- 利用情感词典分析剧情梗概中的情感轨迹,并与标签分布进行比较,以验证语义一致性。
实验结果
研究问题
- RQ1能否从多个来源的噪声性、异构性用户生成标签中系统性地构建一个细粒度、非冗余的标签集?
- RQ2所分配的标签与电影剧情的情感流及叙事结构之间存在何种关联?这些关联是否符合现实世界的预期?
- RQ3从剧情梗概中提取的传统语言学特征在多大程度上能够预测多标签?该任务的基线性能如何?
- RQ4与现有数据集相比,MPST语料库在剧情梗概长度、标签粒度和多标签覆盖范围方面表现如何?
- RQ5该语料库能否支持下游任务,如电影推荐、情感检测和自动标签建议?
主要发现
- MPST语料库包含14,828条电影剧情梗概,平均长度为986.47个词,显著长于类似数据集(如MM-IMDb,平均92.5个词),支持更丰富的叙事分析。
- 最终的标签集包含71个非冗余、语义上明确区分的标签,如“fantasy”(奇幻)、“murder”(谋杀)、“romantic”(浪漫)、“flashback”(闪回)和“insanity”(疯狂),反映剧情结构、类型与情感体验。
- 情感轨迹分析显示,标签分布与预期的情感弧线一致——例如,“horror”(恐怖)和“violence”(暴力)与紧张感上升及负面情绪高峰相关,而“romantic”(浪漫)和“comedy”(喜剧)则表现出更稳定或积极的模式。
- 基于传统语言学特征的多标签分类基准系统取得了0.41的宏F1分数,表明该任务具有非平凡但具挑战性的基线性能。
- 由于其细粒度、经验证的标签结构与高质量的梗概,该语料库在推荐系统、情感检测与叙事理解任务中展现出强大潜力。
- 作者确认,MPST是首个提供细粒度标签与完整电影剧情梗概之间多标签关联的语料库,填补了叙事自然语言处理研究中的关键空白。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。