[论文解读] Unsupervised Graph-based Topic Modeling from Video Transcriptions.
本文提出了一种无监督的基于图的视频转录主题建模方法,利用神经词嵌入和图聚类技术,在无需预先指定主题数量的情况下发现连贯的主题。在MuSe-CaR和纯文本评论数据集上的评估表明,该方法在主题连贯性方面优于基线模型,并在多模态和纯文本数据上均表现出良好的泛化能力。
To unfold the tremendous amount of audiovisual data uploaded daily to social media platforms, effective topic modelling techniques are needed. Existing work tends to apply variants of topic models on text data sets. In this paper, we aim at developing a topic extractor on video transcriptions. The model improves coherence by exploiting neural word embeddings through a graph-based clustering method. Unlike typical topic models, this approach works without knowing the true number of topics. Experimental results on the real-life multimodal data set MuSe-CaR demonstrates that our approach extracts coherent and meaningful topics, outperforming baseline methods. Furthermore, we successfully demonstrate the generalisability of our approach on a pure text review data set.
研究动机与目标
- 为解决从社交媒体平台大规模视频转录中提取有意义主题的挑战。
- 开发一种无需预先提供真实主题数量的主题建模方法。
- 通过整合神经词嵌入与基于图的聚类技术,提升主题连贯性。
- 在多模态视频数据上评估该方法的有效性,并检验其在纯文本评论数据集上的泛化能力。
提出的方法
- 该方法构建一个图结构,其中节点代表词语,边的权重由神经词嵌入计算出的语义相似度决定。
- 通过图聚类进行主题发现,将语义相关的词语分组为连贯的主题,且无需预设主题数量。
- 利用预训练的词嵌入捕捉视频转录中词语之间的语义关系。
- 在图上应用聚类算法,识别出对应于不同主题的密集子图。
- 该框架设计为无监督方法,无需标注数据或指定主题数量。
实验结果
研究问题
- RQ1基于图的词嵌入聚类能否在不预先知道主题数量的情况下,从视频转录中提取出连贯的主题?
- RQ2与基线主题模型相比,该方法在视频转录数据上的主题连贯性表现如何?
- RQ3该方法在纯文本评论数据集上的泛化能力如何?
- RQ4在无监督设置下,词嵌入的引入是否能提升主题质量?
主要发现
- 在MuSe-CaR多模态视频转录数据集上,所提方法的主题连贯性得分高于基线主题建模方法。
- 该模型在无需指定主题数量的情况下,成功从视频转录中发现有意义且可解释的主题。
- 该方法在纯文本评论数据集上表现出良好的泛化能力,显示出在不同文本模态下的鲁棒性。
- 与传统主题模型相比,使用基于图的聚类结合词嵌入显著提升了主题质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。