[论文解读] Automated Content Moderation Increases Adherence to Community Guidelines
本研究基于4.12亿条Facebook评论,采用模糊回归不连续设计,评估自动化内容审核对违规行为和用户参与度的影响。研究发现,删除评论——尤其在短对话中——能显著减少用户后续的违规行为,表明具有显著的威慑效果;而隐藏内容则影响甚微,说明删除在执行社区准则方面更为有效。
Online social media platforms use automated moderation systems to remove or reduce the visibility of rule-breaking content. While previous work has documented the importance of manual content moderation, the effects of automated content moderation remain largely unknown. Here, in a large study of Facebook comments (n=412M), we used a fuzzy regression discontinuity design to measure the impact of automated content moderation on subsequent rule-breaking behavior (number of comments hidden/deleted) and engagement (number of additional comments posted). We found that comment deletion decreased subsequent rule-breaking behavior in shorter threads (20 or fewer comments), even among other participants, suggesting that the intervention prevented conversations from derailing. Further, the effect of deletion on the affected user's subsequent rule-breaking behavior was longer-lived than its effect on reducing commenting in general, suggesting that users were deterred from rule-breaking but not from commenting. In contrast, hiding (rather than deleting) content had small and statistically insignificant effects. Our results suggest that automated content moderation increases adherence to community guidelines.
研究动机与目标
- 评估自动化内容审核对在线社区用户行为的因果影响。
- 比较两种审核干预措施——隐藏与删除——对违规行为和用户参与度的影响。
- 利用Facebook的真实世界数据,探究自动化审核是否具有威慑作用,或是否引发用户反弹。
- 评估审核效果是否因对话长度或用户历史(首次违规者 vs. 多次违规者)而异。
- 为设计高效、可扩展的大规模平台内容审核系统提供基于证据的见解。
提出的方法
- 本研究采用模糊回归不连续设计(RDD),通过利用自动化审核系统中基于阈值的干预措施,估计因果效应。
- 分析由机器学习分类器评估违规风险的Facebook评论,当评分超过预设的隐藏阈值($t_{\text{hide}}$)或删除阈值($t_{\text{delete}}$)时触发干预。
- RDD方法比较评分略高于和略低于这些阈值的评论,将不连续点视为自然实验,以隔离因果效应。
- 结果变量包括后续违规行为(被隐藏/删除的评论数量)和用户参与度(额外发布的评论数量)。
- 分析在用户层面(受影响用户)和对话层面(同一对话中的其他用户)进行,按对话长度和用户类型(首次违规者 vs. 多次违规者)进行分层。
- 统计推断考虑了聚类和异方差性,使用稳健标准误,并在 $p < 0.05$ 水平进行显著性检验。
实验结果
研究问题
- RQ1自动化内容审核,特别是删除违规评论,是否能显著减少同一对话中其他用户的后续违规行为?
- RQ2与隐藏相比,删除在减少违规行为和调节用户参与度方面的效果有何不同?
- RQ3审核的影响是否因对话长度而异,特别是在短对话(≤20条评论)与长对话中?
- RQ4首次违规者是否比多次违规者更易被删除措施所威慑?
- RQ5审核是否导致违规行为增加(即反弹效应),还是促进用户遵守社区准则?
主要发现
- 在20条及以下评论的对话中,删除违规评论显著减少了后续的违规行为,每条对话减少13.16条评论(95% 置信区间:-21.23 至 -5.10),表明具有强烈的威慑效果。
- 删除对减少违规行为的影响持续时间长于其对减少一般评论行为的影响,表明用户虽被有效威慑避免违规,但并未因此减少参与讨论的意愿。
- 隐藏内容对违规行为或用户参与度均无统计显著影响,估计效应接近零,且置信区间覆盖零。
- 对于首次违规者,删除措施在7天内使后续违规行为减少4.55条评论(95% 置信区间:-6.00 至 -3.11),且效果具有持续性。
- 对于多次违规者,删除同样减少了违规行为,但效果较弱,7天内减少3.37条评论(95% 置信区间:-8.35 至 1.61),尽管未达统计显著性。
- 删除措施在短对话中效果最为显著,此类对话更易出现对话偏离风险,表明针对性干预在小型讨论中最为有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。