Skip to main content
QUICK REVIEW

[论文解读] Seeing Seeds Beyond Weeds: Green Teaming Generative AI for Beneficial Uses

Logan Stapleton, Jordan Taylor|arXiv (Cornell University)|May 30, 2023
Ethics and Social Impacts of AI被引用 5
一句话总结

本文提出「绿色渗透」(green teaming)——一種繞過生成式AI內容過濾機制的方法,以實現原本被阻擋的有益應用場景。透過將原本用於過濾有害內容的機制轉化為正面用途,例如自殺干預訓練、除錯教育與政治諷刺,作者展現AI的「缺陷」如何可重新定位為設計資產,挑戰僵化的危害定義,並主張應採用情境敏感、價值導向的AI治理模式。

ABSTRACT

Large generative AI models (GMs) like GPT and DALL-E are trained to generate content for general, wide-ranging purposes. GM content filters are generalized to filter out content which has a risk of harm in many cases, e.g., hate speech. However, prohibited content is not always harmful -- there are instances where generating prohibited content can be beneficial. So, when GMs filter out content, they preclude beneficial use cases along with harmful ones. Which use cases are precluded reflects the values embedded in GM content filtering. Recent work on red teaming proposes methods to bypass GM content filters to generate harmful content. We coin the term green teaming to describe methods of bypassing GM content filters to design for beneficial use cases. We showcase green teaming by: 1) Using ChatGPT as a virtual patient to simulate a person experiencing suicidal ideation, for suicide support training; 2) Using Codex to intentionally generate buggy solutions to train students on debugging; and 3) Examining an Instagram page using Midjourney to generate images of anti-LGBTQ+ politicians in drag. Finally, we discuss how our use cases demonstrate green teaming as both a practical design method and a mode of critique, which problematizes and subverts current understandings of harms and values in generative AI.

研究动机与目标

  • 解決當前生成式AI內容過濾機制的限制,即在特定情境下不僅阻擋有害內容,也錯誤地封鎖有益內容。
  • 批判AI過濾系統中內嵌的價值觀,這些價值觀往往壓抑少數群體的發聲,並限制進步或教育性應用。
  • 提出「綠色滲透」作為實用的設計方法與批判性框架,用以突破限制性內容政策,達成解放性目的。
  • 挑戰「所有被過濾內容皆本質上有害」的假設,主張危害與益處取決於情境,且具有社會脈絡性。
  • 主張應建立更具彈性、情境感知的AI治理模式,允許在教育、心理衛生與社會批判等領域,有意識地運用AI的「缺陷」行為。

提出的方法

  • 使用ChatGPT模擬具有自殺念頭的虛擬病患,透過角色扮演提示繞過內容過濾,以訓練心理健康應變人員。
  • 透過提示Codex產生故意錯誤的程式碼,反向利用其對正確程式碼的偏好,以教導初學程式設計者除錯技巧。
  • 分析一個Instagram帳號,該帳號使用Midjourney生成諷刺性變裝影像,針對反LGBTQ+政治人物進行批判,顯示即使具備社會批判潛力,此類內容仍遭標準內容政策過濾。
  • 將「綠色滲透」概念應用為雙重用途:既是解鎖被阻擋應用場景的設計策略,也是揭露AI過濾系統中內嵌價值觀的批判性視角。
  • 比較不同模型的內容政策(例如OpenAI的廣泛禁令 vs. Midjourney的針對性反偏見規則),以說明政策設計如何決定哪些聲音與應用被允許。
  • 區分AI系統中的顯性與隱性價值:即使無正式政策禁止,隱性規範(如產生「正確」程式碼)亦可能排除有益的應用場景。

实验结果

研究问题

  • RQ1生成式AI內容過濾機制本旨在阻擋有害內容,但如何可能無意中壓抑有益且情境合適的應用?
  • RQ2繞過內容過濾——通常與紅隊滲透的惡意目的相關——如何能重新導向至道德、教育或解放性目標?
  • RQ3將『危害』視為情境依賴而非內容本質,其影響為何?特別是在心理衛生、LGBTQ+表達與教育領域?
  • RQ4AI系統中的顯性與隱性價值如何形塑哪些應用場景被排除?對少數群體有何後果?
  • RQ5生成式AI中的『缺陷』(如產生錯誤或『高風險』內容)能否重新定義為設計特徵,進而啟動具有社會價值的新應用?

主要发现

  • 綠色滲透成功讓ChatGPT在受控且合乎倫理的訓練情境中模擬自殺念頭,顯示原本為安全目的而過濾的內容,可被重新用於拯救生命的教育。
  • 透過提示Codex產生錯誤程式碼,作者建立了一套可行的初學者除錯教學方法,顯示AI傾向產生錯誤的特性,可作為教學工具加以利用。
  • 使用Midjourney生成諷刺性變裝影像,針對反LGBTQ+政治人物,雖遭標準內容政策阻擋,但透過諷刺與抵抗,發揮了關鍵的社會批判功能。
  • 研究發現,內容過濾機制經常排除有益應用場景,並非因為內容本質上有害,而是基於僵化、一刀切的風險與危害定義。
  • 作者發現,隱性價值(如對『正確』程式碼的期待或對『中立』政治言論的假設)與明確政策一樣,具有強大影響力,會限制創新與社會批判。
  • 排除的光譜並非二元:某些內容雖難產生,但非不可能;而綠色滲透提供了一條可行途徑,以接取原本被阻擋的應用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。