[論文レビュー] Seeing Seeds Beyond Weeds: Green Teaming Generative AI for Beneficial Uses
本稿では、生成AIのコンテンツフィルタを回避する方法「グリーンチームング」を紹介する。これは、自殺対応訓練、デバッグ教育、政治風刺など、通常はブロックされるが有益なユースケースを可能にするものである。有害コンテンツをフィルタリングする仕組みを、ポジティブな結果に再利用することで、AIの「欠陥」を設計上の資産に転用し、害の定義をきめつけるのではなく、文脈に応じた価値に基づいたAIガバナンスを提唱する。
Large generative AI models (GMs) like GPT and DALL-E are trained to generate content for general, wide-ranging purposes. GM content filters are generalized to filter out content which has a risk of harm in many cases, e.g., hate speech. However, prohibited content is not always harmful -- there are instances where generating prohibited content can be beneficial. So, when GMs filter out content, they preclude beneficial use cases along with harmful ones. Which use cases are precluded reflects the values embedded in GM content filtering. Recent work on red teaming proposes methods to bypass GM content filters to generate harmful content. We coin the term green teaming to describe methods of bypassing GM content filters to design for beneficial use cases. We showcase green teaming by: 1) Using ChatGPT as a virtual patient to simulate a person experiencing suicidal ideation, for suicide support training; 2) Using Codex to intentionally generate buggy solutions to train students on debugging; and 3) Examining an Instagram page using Midjourney to generate images of anti-LGBTQ+ politicians in drag. Finally, we discuss how our use cases demonstrate green teaming as both a practical design method and a mode of critique, which problematizes and subverts current understandings of harms and values in generative AI.
研究の動機と目的
- 現在の生成AIコンテンツフィルタが、有害な内容だけでなく、文脈に応じたユースケースにおいても有益な内容をブロックするという限界を是正すること。
- マイノリティの声を不均衡に沈黙させ、プログレッシブな応用や教育的応用を制限するAIフィルタリングシステムに埋め込まれた価値観を批判すること。
- グリーンチームングを、制限的なコンテンツポリシーを脱却し、解放的・解放的目的を達成するための実用的設計手法および批判的枠組みとして提唱すること。
- すべてのフィルタリング対象コンテンツが本質的に有害であるという仮定を疑問視し、害と利益は文脈依存的で社会的に構築されたものであると主張すること。
- 教育、メンタルヘルス、社会的批評の分野で、『欠陥』のあるAI行動を意図的かつ主体的につかえる柔軟で文脈に配慮したAIガバナンスを提唱すること。
提案手法
- ChatGPTを用いて自殺的思考を示す仮想患者をシミュレートし、ロールプレイのプロンプトによってコンテンツフィルタを回避することで、メンタルヘルス対応者を訓練する。
- Codexが正しいコードを好む傾向を逆手に取り、初心者のプログラマーにデバッグスキルを教えるために意図的にバグのあるソリューションを生成させるプロンプトを提示する。
- InstagramのページがMidjourneyを用いてLGBTQ+に反発的な政治家を風刺的にドラッグストア風に描く画像を生成しているが、これは社会的批評の潜在的機能を持つにもかかわらず、標準的なコンテンツポリシーでブロックされている。
- グリーンチームングの概念を二重の目的で応用する:ブロックされたユースケースを解き放つ設計戦略としての役割と、AIフィルタリングシステムに埋め込まれた価値を露呈する批判的レンズとしての役割。
- OpenAIの広範な禁止ポリシーとMidjourneyの的を絞ったバイアス防止ルールを比較することで、ポリシー設計がどの声や応用が許可されるかをどのように規定するかを示す。
- AIシステムにおける明示的価値と暗黙的価値の区別を行う。暗黙的規範(例:「正しい」コードを生成すること)は、公式な禁止規定がなくても、有益なユースケースを排除する可能性がある。
実験結果
リサーチクエスチョン
- RQ1生成AIのコンテンツフィルタは、有害なコンテンツをブロックすることを目的としているが、どのようにして文脈的に適切な応用を誤って抑制してしまうのか?
- RQ2通常は悪意ある目的のためのレッドチームングと関連づけられるコンテンツフィルタの回避を、どのようにして倫理的・教育的・解放的目標に向けることができるのか?
- RQ3「害」という概念を本質的ではなく文脈依存的とみなすことの意味は何か。特にメンタルヘルス、LGBTQ+表現、教育分野において。
- RQ4AIシステムにおける明示的価値と暗黙的価値は、どのようないくつかのユースケースが排除されるかを規定するのか。その結果、マイノリティコミュニティにどのような影響を与えるのか?
- RQ5生成AIの『欠陥』——誤った、あるいは『危険』なコンテンツを生成する傾向——を、新しい社会的価値のある応用を可能にする設計的特徴に再定義できるのか?
主な発見
- グリーンチームングにより、ChatGPTを用いて自殺的思考を模倣する制御された倫理的訓練環境を実現した。これは、安全のためのフィルタリング対象となったコンテンツが、命を救う教育に再利用可能であることを示している。
- Codexにバグだらけのコードを生成させるプロンプトを提示することで、初心者向けのデバッグ教育に有効な方法を創出。AIが誤りを生成する傾向が、教育的ツールとして活用可能であることが示された。
- Midjourneyを用いてLGBTQ+に反発的な政治家を風刺的にドラッグストア風に描いた画像は、標準的なコンテンツポリシーでブロックされたが、風刺と抵抗の手段として、憎悪発言を逆転させる重要な社会的機能を果たしていた。
- 本研究では、コンテンツフィルタが有益なユースケースを排除するのは、コンテンツ自体が本質的に有害だからではなく、リスクと害の定義が硬直的で、一様な適用基準であることが判明した。
- 著者らは、暗黙的価値——例えば「正しい」コードの生成や「中立的」な政治的議論——が、公式な禁止規定がなくても、イノベーションや社会的批評の制限に大きな影響を与えていることを発見した。
- 排除のスケールは二元論的ではない。一部のコンテンツは生成が困難ではあるが、不可能ではない。グリーンチームングは、それらが通常ブロックされるアプリケーションに到達するための実用的で代替可能な道筋を提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。