Skip to main content
QUICK REVIEW

[论文解读] Rating for Parents: Predicting Children Suitability Rating for Movies Based on Language of the Movies

Mahsa Shafaei, Niloofar Safi Samghabadi|arXiv (Cornell University)|Aug 21, 2019
Hate Speech and Cyberbullying Detection参考文献 20被引用 8
一句话总结

本文提出了一种基于RNN的深度学习模型,结合注意力机制,联合分析电影剧本中的类型、对白和情感内容,以预测儿童适宜性的MPAA评级。该模型取得了78%的加权F1得分,较传统机器学习方法高出6%,并首次发布了包含7,000部电影剧本、标注有MPAA评级的大规模数据集。

ABSTRACT

The film culture has grown tremendously in recent years. The large number of streaming services put films as one of the most convenient forms of entertainment in today's world. Films can help us learn and inspire societal change. But they can also negatively affect viewers. In this paper, our goal is to predict the suitability of the movie content for children and young adults based on scripts. The criterion that we use to measure suitability is the MPAA rating that is specifically designed for this purpose. We propose an RNN based architecture with attention that jointly models the genre and the emotions in the script to predict the MPAA rating. We achieve 78% weighted F1-score for the classification model that outperforms the traditional machine learning method by 6%.

研究动机与目标

  • 开发一种基于电影剧本自动预测MPAA评级的系统,以支持家长指导和早期制作决策。
  • 解决人工评级流程的局限性,其过程缓慢、不可扩展,且通常在制作完成后才应用。
  • 创建一个包含MPAA评级的电影剧本数据集,以支持自动化预测模型的基准测试。
  • 研究类型、情感内容和对白对MPAA评级预测的联合影响。
  • 通过端到端的深度学习建模语言上下文,减少对静态不良词汇列表的依赖。

提出的方法

  • 使用基于序列的RNN架构并结合注意力机制,以建模电影剧本中角色之间的对白流动。
  • 将类型嵌入和情感嵌入(来自对白中的情感检测)作为辅助输入整合到RNN中。
  • 采用端到端学习,从原始文本中进行训练,无需依赖预定义的负面词汇词典。
  • 训练模型将剧本分类为五类MPAA评级:G、PG、PG-13、R、NC-17。
  • 利用注意力权重解释模型预测,并分析误分类样本中的关键词语。
  • 与基于阈值的不良词汇列表的传统机器学习基线方法进行性能比较。

实验结果

研究问题

  • RQ1仅使用电影剧本,端到端的深度学习模型能否准确预测MPAA评级?
  • RQ2对白中的类型和情感内容如何影响模型预测适宜性评级的能力?
  • RQ3由于上下文和语义限制,传统不良词汇列表在多大程度上无法准确预测MPAA评级?
  • RQ4模型的注意力机制是否能突出与MPAA评级标准一致的有意义语言模式?
  • RQ5所提出的模型能否在预测MPAA评级方面超越传统机器学习基线方法?

主要发现

  • 所提出的基于RNN并结合注意力机制的模型取得了78%的加权F1得分,较传统机器学习方法高出6%。
  • 模型的注意力机制在NC-17评级剧本中突出显示了上下文相关的词语,如“fuck”和“motherfucker”,表明其对语言上下文的敏感性。
  • 随着MPAA评级的严格程度提高,负面词汇的频率显著上升,NC-17剧本中不良词汇占比达1.68%,而G级电影仅为0.17%。
  • 误分类样本通常涉及被赋予高注意力权重的中性词语,表明低资源类别中存在数据稀疏性或语义模糊性。
  • 分析结果表明,仅靠不良词汇频率不足以实现准确预测,因为其上下文差异和在不同类型中的语义影响各不相同。
  • 实证结果表明,类型和情感内容是重要预测因子,情感强度和主题内容对评级分类具有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。