[論文レビュー] Safety and Fairness for Content Moderation in Generative Models
本論文は、敵対的プロンプトと自動ラベル付けを用いて有害出力を定量化することで、テキスト対画像生成AIシステムにおける安全性、公平性、メトリクスの公平性を測定する理論的枠組みを提案する。95パーセンタイルの性的に露骨なコンテンツフィルタが反事実的公平性を達成しており、女性的・男性的表現の個人をほぼ同一の割合(3.6% 対 3.7%)でブロックしていることが示され、根拠に基づく、公平なコンテンツモデレーション意思決定を支援する。
With significant advances in generative AI, new technologies are rapidly being deployed with generative components. Generative models are typically trained on large datasets, resulting in model behaviors that can mimic the worst of the content in the training data. Responsible deployment of generative technologies requires content moderation strategies, such as safety input and output filters. Here, we provide a theoretical framework for conceptualizing responsible content moderation of text-to-image generative technologies, including a demonstration of how to empirically measure the constructs we enumerate. We define and distinguish the concepts of safety, fairness, and metric equity, and enumerate example harms that can come in each domain. We then provide a demonstration of how the defined harms can be quantified. We conclude with a summary of how the style of harms quantification we demonstrate enables data-driven content moderation decisions.
研究の動機と目的
- 生成AIシステムにおける安全性、公平性、メトリクスの公平性を定義・測定する、実行可能でデータドリブンなフレームワークの開発。
- 正解出力が存在せず文脈に依存する生成モデルにおける公平性評価の課題に対処する。
- テキスト対画像生成出力における差別的、暴力的、性的に露骨な内容といった有害性を実証的に定量化する。
- コンテンツモデレーションフィルタが、特に性別表現に基づいてマイノリティのグループに不均衡に影響を与えるかどうかを評価する。
- スケーラブルで測定可能な有害性メトリクスを用いて、根拠に基づくコンテンツモデレーション意思決定を可能にする。
提案手法
- 性別表現を標的とする多様で感受性の高い、かつ有害な可能性のあるプロンプトを生成するための敵対的プロンプト工学。
- 事前学習済み分類器を用いて、生成画像の機械的ラベル付けを自動化し、嫌がらせ的、暴力的、性的に露骨な内容を検出。
- プロンプトペア(例:「女性の医師」対「男性の医師」)の違いが性別代名詞に限る場合に、反事実的公平性分析を適用。
- 性別サブセット全体にわたり、性的に露骨なコンテンツの95パーセンタイル閾値におけるフィルタのパフォーマンスを測定。
- 統計的平等性と反事実的公平性メトリクスを用いて、モデレーション意思決定が異なるデモグラフィックグループを公平に扱っているかどうかを評価。
- 安全性、公平性、メトリクスの公平性を統合的に評価するフレームワークとして、生成AIコンテンツモデレーションに統合。

実験結果
リサーチクエスチョン
- RQ1正解出力が存在しない状況において、テキスト対画像生成AIシステムにおける安全性と公平性をどのように意味的に定義・測定できるか?
- RQ2性的に露骨なコンテンツ向けのコンテンツモデレーションフィルタが、女性的表現の個人と男性的表現の個人の画像に、どの程度不均衡に影響を与えるか?
- RQ3プロンプトペア比較を用いて、生成AIシステムにおける反事実的公平性を実証的に評価できるか?
- RQ4差別的、暴力的、性的に露骨な内容といった有害なコンテンツの種類が、性別を含むプロンプトの下で生成画像にどのように現れるか?
- RQ5スケーラブルで自動化されたメトリクスは、公平で根拠に基づいたコンテンツモデレーション意思決定を可能にする役割を果たすか?
主な発見
- 性的に露骨なコンテンツフィルタは、女性的表現の個人の画像を3.6%の割合でブロックし、男性的表現の個人の画像を3.7%の割合でブロックしており、ブロッキング率にほぼ同等の差がないことが示された。
- マッチドされた反事実的プロンプトサブセットにおいて、女性プロンプトからの画像の1.2%と男性プロンプトからの画像の2.4%がブロックされ、1.2%の差が1%の誤差範囲内に収まっている。
- 性的に露骨なコンテンツの95パーセンタイル閾値は、両グループがほぼ同一の割合でペナルティを受けるため、反事実的公平性を達成した。
- 本フレームワークは、人間の評価者に依存せずに、スケーラブルで自動化された安全性と公平性の測定を可能にする。
- 本研究は、有害性メトリクスを定量的に根拠にした意思決定が、根拠に基づき、かつ公平に実施できることを示している。
- 本アプローチは、ガバナンスの目標と整合し、マイノリティグループへの不均衡な影響を低減する、用途に特化したコンテンツモデレーションポリシーの策定を支援する。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。