Skip to main content
QUICK REVIEW

[论文解读] Predicting Movie Genres Based on Plot Summaries

Quan Hoang|arXiv (Cornell University)|Jan 15, 2018
Video Analysis and Summarization参考文献 14被引用 11
一句话总结

本文提出一种基于剧情摘要的多标签电影类型分类深度学习方法,采用门控循环单元(GRU)网络结合概率分类与学习到的概率阈值。该方法在超过25万部电影的数据集上实现了50.0%的Jaccard指数、0.56的F-score以及80.5%的命中率,优于朴素贝叶斯、Word2Vec+XGBoost以及其它多标签策略。

ABSTRACT

This project explores several Machine Learning methods to predict movie genres based on plot summaries. Naive Bayes, Word2Vec+XGBoost and Recurrent Neural Networks are used for text classification, while K-binary transformation, rank method and probabilistic classification with learned probability threshold are employed for the multi-label problem involved in the genre tagging task.Experiments with more than 250,000 movies show that employing the Gated Recurrent Units (GRU) neural networks for the probabilistic classification with learned probability threshold approach achieves the best result on the test set. The model attains a Jaccard Index of 50.0%, a F-score of 0.56, and a hit rate of 80.5%.

研究动机与目标

  • 为解决从剧情摘要进行多标签电影类型预测的挑战,该任务通常依赖IMDB提交进行人工处理。
  • 评估并比较多种机器学习方法,包括朴素贝叶斯、Word2Vec+XGBoost以及RNN,在基于文本的类型分类中的表现。
  • 通过结合概率分类与学习到的概率阈值,提升多标签分类问题的性能。
  • 探究深度神经网络(特别是GRU)在捕捉电影剧情摘要中序列与上下文模式方面的有效性。
  • 识别现有方法的局限性,如对罕见词和类别不平衡处理不佳,并提出相应解决方案。

提出的方法

  • 本研究采用门控循环单元(GRU)神经网络,以建模剧情摘要中的序列依赖关系,用于类型预测。
  • 采用概率分类框架,模型为每个类型输出概率,学习到的阈值决定最终预测标签。
  • 通过最小二乘回归方法优化概率阈值,以最小化真实标签与错误标签的误排序。
  • 使用预训练的Word2Vec获取词嵌入,将剧情摘要中的词表示为向量后输入GRU模型。
  • 通过三种策略解决多标签问题:k-二值化转换、基于排名的标注以及带阈值学习的概率分类。
  • 模型在包含超过25万部电影、附带类型标注与剧情摘要的大规模数据集上进行训练与评估。

实验结果

研究问题

  • RQ1基于GRU的深度循环神经网络是否能在从剧情摘要预测多标签电影类型方面优于传统机器学习模型(如朴素贝叶斯和XGBoost)?
  • RQ2将概率分类与学习到的概率阈值结合,是否能优于k-二值化转换或基于排名的方法,在多标签文本分类中取得更好性能?
  • RQ3词嵌入表示(如Word2Vec)及其平均化处理如何影响类型分类模型的性能?
  • RQ4罕见词与未登录词(UNK)在多大程度上影响模型性能?上下文适应能否改善结果?
  • RQ5电影类型中的类别不平衡(如戏剧与喜剧占主导)如何影响模型偏差与预测性能?

主要发现

  • 基于GRU的概率分类与学习到的阈值模型表现最佳,Jaccard指数达到50.0%。
  • 该模型实现了0.56的F-score与80.5%的命中率,表明在每部电影中至少预测出一个正确类型的性能较强。
  • Word2Vec + XGBoost表现欠佳,原因在于词嵌入平均化无法捕捉有意义的文档级表示。
  • 与概率阈值方法相比,k-二值化转换与基于排名的方法表现较差,尤其在处理模糊或重叠的类型标签时。
  • 模型在罕见词(46%的词汇出现次数少于20次)与UNK标记(75%的标记)上表现受限,限制了表征学习能力。
  • 类别不平衡使模型偏向于主流类型(如戏剧与喜剧),提示未来工作应关注长尾类型预测问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。