Skip to main content
QUICK REVIEW

[论文解读] Who is Addressed in this Comment? Automatically Classifying Meta-Comments in News Comments

Marlo Häring, Wiebke Loosen|arXiv (Cornell University)|Oct 2, 2018
Topic Modeling参考文献 39被引用 6
一句话总结

本文提出一种自动化方法,利用传统监督学习与端到端深度学习结合词嵌入技术,对在线新闻论坛中的元评论(即针对记者、新闻编辑部或版主的评论)进行分类。该方法在德语新闻评论数据集上实现了76%至91%的F₀.₅分数,表现出优异性能,并在提升用户与记者互动及新闻编辑部反馈系统方面具有实际应用价值。

ABSTRACT

User comments have become an essential part of online journalism. However, newsrooms are often overwhelmed by the vast number of diverse comments, for which a manual analysis is barely feasible. Identifying meta-comments that address or mention newsrooms, individual journalists, or moderators and that may call for reactions is particularly critical. In this paper, we present an automated approach to identify and classify meta-comments. We compare comment classification based on manually extracted features with an end-to-end learning approach. We develop, optimize, and evaluate multiple classifiers on a comment dataset of the large German online newsroom SPIEGEL Online and the 'One Million Posts' corpus of DER STANDARD, an Austrian newspaper. Both optimized classification approaches achieved encouraging $F_{0.5}$ values between 76% and 91%. We report on the most significant classification features with the results of a qualitative analysis and discuss how our work contributes to making participation in online journalism more constructive.

研究动机与目标

  • 为解决在线新闻中用户评论数量庞大、仅有少量包含可操作反馈的问题。
  • 开发一种自动化系统,识别元评论(即不针对文章主题,而是关于新闻实践、媒体机构或审核行为的评论),从而实现有针对性的回应。
  • 比较传统基于特征的机器学习方法与端到端神经网络方法在德语新闻评论数据集上分类元评论的性能。
  • 通过识别建设性用户反馈、更正意见、功能请求及需回复的问题,为新闻编辑部和版主提供可操作的见解。
  • 通过自动化评论分析支持开发可扩展工具,促进媒体组织与受众之间的对话。

提出的方法

  • 本研究使用两个数据集:SPIEGEL Online 和 DER STANDARD 的 'One Million Posts' 语料库,总计约1100万条德语用户评论。
  • 在完整评论语料库上训练词嵌入与评论嵌入,以捕捉语义特征,支持迁移学习并提升特征表示能力。
  • 采用基于人工提取的语言学与结构特征的监督学习方法,包括提及模式、标点符号和词汇线索。
  • 开发基于神经网络的端到端深度学习模型,使用学习得到的词嵌入,实现特征提取与分类的联合优化。
  • 对两种方法均应用超参数调优以优化性能,模型评估以F₀.₅为主要指标。
  • 对误分类样本与高置信度预测结果进行定性分析,以验证模型的可解释性与相关性。

实验结果

研究问题

  • RQ1使用人工设计特征的监督学习方法在分类针对记者、新闻编辑部或版主的元评论方面效果如何?
  • RQ2使用学习得到的词嵌入的端到端深度学习模型是否能优于传统的基于特征的分类方法?
  • RQ3哪些最具影响力的语言学与结构特征能够区分元评论与普通文章相关评论?
  • RQ4分类结果在两个具有不同评论文化的大规模真实德语新闻评论数据集上是否具有良好的泛化能力?
  • RQ5在在线新闻中自动识别元评论可衍生出哪些实际应用场景?

主要发现

  • 基于监督学习的方法在两个数据集上均实现了76%至85%的F₀.₅分数,表明手工特征具有强大性能。
  • 端到端深度学习模型在 'One Million Posts' 数据集上优于传统方法,F₀.₅分数达到91%。
  • 两个数据集中均显著的特征包括显式提及标记(如 'an die Redaktion')、标点符号模式以及表示直接称呼的句法结构。
  • 定性分析表明,模型成功捕捉了多种建设性反馈形式,包括更正意见、问题、功能请求以及对审核行为的投诉。
  • 本研究表明,在大规模用户评论上预训练的词嵌入能显著提升分类性能,尤其在捕捉语义意图方面。
  • 结果表明,自动化元评论检测可帮助新闻编辑部识别值得回应的反馈,提升透明度与受众参与度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。