[论文解读] A Holistic Approach to Undesired Content Detection in the Real World
本文提出了一套全面且可投入生产的框架,用于检测真实语言模型输出中各种形式的不良内容,如仇恨言论、自残行为和骚扰。通过结合主动学习、严格的数据质量控制、合成数据增强以及稳健的模型训练,该方法在罕见类别上实现了显著的性能提升,优于现成模型,并能有效应对数据分布偏移问题。
We present a holistic approach to building a robust and useful natural language classification system for real-world content moderation. The success of such a system relies on a chain of carefully designed and executed steps, including the design of content taxonomies and labeling instructions, data quality control, an active learning pipeline to capture rare events, and a variety of methods to make the model robust and to avoid overfitting. Our moderation system is trained to detect a broad set of categories of undesired content, including sexual content, hateful content, violence, self-harm, and harassment. This approach generalizes to a wide range of different content taxonomies and can be used to create high-quality content classifiers that outperform off-the-shelf models.
研究动机与目标
- 开发一个可扩展、生产级的内容审核系统,能够泛化于多样化的现实应用场景。
- 解决罕见且主观的不良内容类别所带来的挑战,这些类别具有较高的评分者间差异性。
- 通过在生产流量上应用主动学习,而非依赖公开数据集,减少数据分布偏移。
- 通过合成数据和红队测试,提升模型对常见短语或模板的鲁棒性,防止过拟合。
- 通过为标注人员提供心理健康支持和退出权利,确保伦理化的数据标注实践。
提出的方法
- 设计一个详细且具有文化敏感性的内容分类体系,辅以清晰的指南,以最小化标注的主观性。
- 实施多阶段数据流水线,包含严格的质控措施,包括定期校准和以精确度为导向的标注说明。
- 利用主动学习从生产流量中直接采样罕见的不良内容,使罕见类别数据量提升至最多22倍。
- 通过合成数据生成和人工精选示例,纠正模型对常见短语或模板的过拟合问题。
- 采用半监督学习和不确定性估计,提升模型泛化能力,处理模糊案例。
- 集成安全与隐私控制机制,防止数据泄露,并确保基于同意的数据使用。
实验结果
研究问题
- RQ1内容审核系统如何在多样、罕见且主观的不良内容类别上保持高性能?
- RQ2与公开数据集相比,在生产数据上应用主动学习在提升罕见内容检测能力方面能达到何种程度?
- RQ3在处理主观且敏感的内容时,如何保持数据质量和标注一致性?
- RQ4合成数据和模型红队测试对减少对常见短语模式的过拟合有何影响?
- RQ5如何在大规模内容审核流水线中实现伦理且安全的数据标注实践?
主要发现
- 在生产数据上应用主动学习,使罕见类别样本收集量最高提升22倍,从而将低资源类别的性能提升最高达10倍。
- 公开数据集虽然在初始冷启动阶段有帮助,但在积累足够高质量标注数据后,若再加入反而会降低模型性能。
- 通过合成数据和红队测试,成功缓解了模型对常见短语模板(如“X是仇恨的”)的过拟合问题,提升了模型鲁棒性。
- 该系统在性能上可与基于聚合标签训练的模型比肩或更优,同时保留了与人工标注者分歧程度一致的不确定性估计。
- 伦理化标注实践(包括心理健康支持和退出权利)已成功集成至流水线中,且未影响数据质量。
- 该框架在多种内容分类体系中均表现出强大的泛化能力,在真实部署场景中优于现成模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。