[论文解读] Hybrid Approaches to Detect Comments Violating Macro Norms on Reddit
本文提出一种混合方法,通过分类、主题建模和开放式编码,对40,000条被版主删除的Reddit评论进行识别与标注,划分为8种广泛实施的宏观规范——如仇恨言论、广告推广和自我推广等。主要贡献在于发布了一个包含超过200万条被删除评论的公开数据集,并附有细粒度的规范违反标签,从而支持更精细的在线内容审核机器学习模型开发。
In this dataset paper, we present a three-stage process to collect Reddit comments that are removed comments by moderators of several subreddits, for violating subreddit rules and guidelines. Other than the fact that these comments were flagged by moderators for violating community norms, we do not have any other information regarding the nature of the violations. Through this procedure, we collect over 2M comments removed by moderators of 100 different Reddit communities, and publicly release the data. Working with this dataset of removed comments, we identify 8 macro norms---norms that are widely enforced on most parts of Reddit. We extract these macro norms by employing a hybrid approach---classification, topic modeling, and open-coding---on comments identified to be norm violations within at least 85 out of the 100 study subreddits. Finally, we label over 40K Reddit comments removed by moderators according to the specific type of macro norm being violated, and make this dataset publicly available. By breaking down a collection of removed comments into more granular types of macro norm violation, our dataset can be used to train more nuanced machine learning classifiers for online moderation.
研究动机与目标
- 收集并发布大规模Reddit评论数据集,这些评论因违反社区规范而被版主删除。
- 通过结合分类、主题建模和人工编码的混合方法,识别Reddit子版块中广泛实施的宏观规范。
- 对超过40,000条被删除评论进行特定类型规范违反的标注,以支持更精细的机器学习分类器在在线内容审核中的训练。
- 提供一个可扩展的计算框架,用于理解在线社区中规范违反的全貌。
- 通过提供细粒度、上下文感知的被删除内容标注,支持未来混合协作式内容审核工具的研究。
提出的方法
- 使用Reddit流媒体API进行三阶段数据收集流程,捕获r/all中发布的所有评论,随后延迟24小时以等待版主处理。
- 训练100个针对不同子版块的二分类器,用于识别各子版块中被删除的评论,平均F1得分为71.4%。
- 对违反宏观规范的评论应用主题建模,提取出10个潜在主题,随后通过开放式编码将每个主题映射到特定的宏观规范。
- 基于其最佳匹配主题对评论进行标注,优先选择每个主题中前5,000条评论,以减少低置信度标注带来的噪声。
- 采用混合处理流程,结合自动化分类、无监督主题建模和人工验证,以确保标签的可靠性与可扩展性。
- 通过公开DOI发布完整的200万条被删除评论数据集及40,000条规范违反标注,供研究使用。
实验结果
研究问题
- RQ1Reddit社区中广泛实施的宏观规范有哪些?如何实现大规模、系统化的识别?
- RQ2如何通过结合分类、主题建模和开放式编码的混合方法,实现对大规模在线内容中规范违反行为的计算化标注?
- RQ3自动化标注被删除评论在多大程度上能反映人类版主实际意图的规范违反?
- RQ4在不同子版块中,识别出的宏观规范在违规频率和类型上存在哪些差异?
- RQ5在在线社区中使用自动化方法标注已删除内容时,存在哪些局限性和风险?
主要发现
- 本研究在Reddit上识别出8种广泛实施的宏观规范,包括仇恨言论、自我推广、广告推广和骚扰等,这些规范在不同子版块中均被一致执行。
- 用于识别被删除评论的子版块分类器在10折交叉验证中达到平均71.4%的F1分数,表明其在大规模数据收集中具有中等但可接受的性能。
- 主题建模成功降低了规范违反评论的维度,并实现了10个潜在主题的识别,随后通过开放式编码将这些主题映射到宏观规范。
- 基于主题匹配度,选取每个主题中前5,000条评论,有效减少了误报,确保了规范违反标注的高置信度。
- 最终数据集包含超过200万条被删除评论,以及40,000条标注了具体宏观规范违反的评论,均已公开发布供研究使用。
- 该数据集使训练更精细的机器学习模型用于在线内容审核成为可能,使社区能够针对性地识别特定类型的违规行为,而非依赖通用的二分类器。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。