Skip to main content
QUICK REVIEW

[论文解读] Safety and Fairness for Content Moderation in Generative Models

Susan Hao, Piyush Kumar|arXiv (Cornell University)|Jun 9, 2023
Hate Speech and Cyberbullying Detection被引用 5
一句话总结

本文提出了一套理论框架,用于衡量文本到图像生成式AI系统中的安全性、公平性及度量公平性,通过对抗性提示和自动化标注来量化有害输出。结果表明,95百分位数的色情内容过滤器实现了反事实公平性,对呈现女性特征和男性特征个体的图像阻拦率几乎相同(分别为3.6%和3.7%),支持基于证据的、公平的内容审核决策。

ABSTRACT

With significant advances in generative AI, new technologies are rapidly being deployed with generative components. Generative models are typically trained on large datasets, resulting in model behaviors that can mimic the worst of the content in the training data. Responsible deployment of generative technologies requires content moderation strategies, such as safety input and output filters. Here, we provide a theoretical framework for conceptualizing responsible content moderation of text-to-image generative technologies, including a demonstration of how to empirically measure the constructs we enumerate. We define and distinguish the concepts of safety, fairness, and metric equity, and enumerate example harms that can come in each domain. We then provide a demonstration of how the defined harms can be quantified. We conclude with a summary of how the style of harms quantification we demonstrate enables data-driven content moderation decisions.

研究动机与目标

  • 开发一种可行的、数据驱动的框架,用于定义和衡量生成式AI系统中的安全性、公平性及度量公平性。
  • 解决评估生成模型公平性所面临的挑战,这些模型缺乏单一正确输出且具有上下文敏感性。
  • 实证量化文本到图像生成输出中仇恨、暴力和色情内容等危害。
  • 评估内容审核过滤器是否不成比例地影响边缘化群体,尤其是按性别表现形式区分的群体。
  • 通过可扩展、可度量的危害指标,实现基于证据的内容审核决策。

提出的方法

  • 通过对抗性提示工程生成多样化、敏感且可能具有危害性的提示,专门针对性别化表征。
  • 使用预训练分类器对生成的图像进行自动化机器标注,识别仇恨、暴力和色情内容。
  • 通过比较仅在性别代词上不同的提示对(例如,“一位女性医生”与“一位男性医生”)进行反事实公平性分析。
  • 在性别子集中测量95百分位数阈值下对色情内容的过滤器性能。
  • 使用统计均等性和反事实公平性度量,评估审核决策是否公平对待不同人口群体。
  • 将安全性、公平性和度量公平性整合进统一的生成式AI内容审核评估框架中。
Figure 1 : Sexually explicit histogram.
Figure 1 : Sexually explicit histogram.

实验结果

研究问题

  • RQ1在缺乏单一正确输出的情况下,如何有意义地定义并衡量文本到图像生成式AI系统中的安全性和公平性?
  • RQ2针对色情内容的过滤器在多大程度上不成比例地影响呈现女性特征与男性特征个体的图像?
  • RQ3能否通过提示对比较在生成式AI系统中实证评估反事实公平性?
  • RQ4不同类型的有害内容(仇恨、暴力、色情)在性别化提示生成的图像中如何表现?
  • RQ5可扩展的、自动化的度量在实现公平且基于证据的内容审核决策中发挥何种作用?

主要发现

  • 色情内容过滤器对呈现女性特征个体的图像阻拦率为3.6%,对呈现男性特征个体的图像阻拦率为3.7%,表明阻拦率近乎一致。
  • 在匹配的反事实提示子集中,女性提示生成的图像中有1.2%被阻拦,男性提示生成的图像中有2.4%被阻拦,差异为1.2%,在1%的误差范围内。
  • 95百分位数的色情内容阈值实现了反事实公平性,因为两组被惩罚的比率几乎相同。
  • 该框架实现了可扩展的、自动化的安全性与公平性测量,无需完全依赖人工评分者。
  • 研究表明,当基于可量化的危害度量时,内容审核决策可以既基于证据又实现公平。
  • 该方法支持针对特定使用场景的定制化内容审核策略,与治理目标保持一致,并减少对边缘化群体的不成比例影响。
Figure 2 : Violence histogram.
Figure 2 : Violence histogram.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。