Skip to main content
QUICK REVIEW

[论文解读] Explainability Pitfalls: Beyond Dark Patterns in Explainable AI

Upol Ehsan, Mark Riedl|arXiv (Cornell University)|Sep 26, 2021
Explainable Artificial Intelligence (XAI)参考文献 32被引用 17
一句话总结

本文提出了「可解释性陷阱」(EPs)——即使在無惡意意圖的情況下,AI 解釋所產生的非預期負面下游影響,與黑暗模式不同。透過案例研究,本文識別出數值解釋如何導致使用者產生錯誤的信任,並提出在研究、設計與組織層級的主動策略,透過有瑕疿的設計與 EP 認知教育計畫,以偵測與預防此類陷阱。

ABSTRACT

To make Explainable AI (XAI) systems trustworthy, understanding harmful effects is just as important as producing well-designed explanations. In this paper, we address an important yet unarticulated type of negative effect in XAI. We introduce explainability pitfalls(EPs), unanticipated negative downstream effects from AI explanations manifesting even when there is no intention to manipulate users. EPs are different from, yet related to, dark patterns, which are intentionally deceptive practices. We articulate the concept of EPs by demarcating it from dark patterns and highlighting the challenges arising from uncertainties around pitfalls. We situate and operationalize the concept using a case study that showcases how, despite best intentions, unsuspecting negative effects such as unwarranted trust in numerical explanations can emerge. We propose proactive and preventative strategies to address EPs at three interconnected levels: research, design, and organizational.

研究动机与目标

  • 識別並概念化可解釋性陷阱(EPs),即非預期的負面影響,發生於 AI 解釋中,且無意圖欺騙。
  • 透過強調 EPs 的無惡意與意圖性,將 EPs 與黑暗模式區分開來。
  • 透過一項控制性案例研究,操作化 EPs,探討使用者對數值與自然語言解釋的感知差異。
  • 提出主動的、多層級策略——研究、設計與組織層級——以偵測與預防 XAI 系統中的 EPs。
  • 透過提高對解釋安全性中先前未明確表達的知識盲點之警覺,擴展 XAI 設計空間。

提出的方法

  • 進行一項控制性使用者研究,比較三種 AI 解釋類型的感知差異:帶有理由的自然語言解釋、不帶理由的自然語言解釋,以及無上下文的數值解釋。
  • 分析使用者的質性回饋,識別誤解模式,例如對數值輸出產生錯誤的信任。
  • 運用推測性與反思性設計方法,模擬潛在陷阱,並構想 XAI 系統中「可能出錯之處」。
  • 提出「有瑕疪解釋」——策略性地揭露系統機制,同時隱藏干擾因素——以促進反思性思考,減少對具有誤導性的數值線索的依賴。
  • 引入「陷阱認知教育計畫」,針對設計師與使用者,透過參與式設計與模擬練習,提升對 EPs 的警覺。
  • 主張在組織層級建立訓練與評估架構,將 EP 警覺融入 XAI 的開發與評估流程。

实验结果

研究问题

  • RQ1具備與不具備 AI 背景的使用者,如何感知 AI 系統中無上下文的數值解釋?
  • RQ2即使設計者無意欺騙,AI 解釋會引發哪些非預期的負面影響?
  • RQ3數值解釋在哪些方面導致使用者產生錯誤信任或認知錯位?
  • RQ4如何應用有瑕疪設計原則來緩解可解釋性陷阱?
  • RQ5哪些組織與教育策略能提升對解釋非預期負面影響的韌性?

主要发现

  • 缺乏 AI 背景的使用者對無上下文數值解釋的錯誤信任程度,顯著高於對自然語言解釋的錯誤信任,即使數值本身無上下文。
  • 即使無意欺騙,數值解釋仍導致使用者高估 AI 的可靠性與決策透明度。
  • 案例研究顯示,使用者經常將數值輸出誤解為本質上客觀或具有權威性,進而過度依賴它們。
  • 有瑕疪解釋——特別是互動式反事實情境——被證明能促進反思性思考,減少導致陷阱的認知捷徑。
  • 參與者在接觸對比性「如果…會怎樣」情境後,對系統限制的警覺性顯著提升,顯示此類方法可緩解 EPs。
  • 本研究強調需要推動 EP 認知教育計畫,使設計師與使用者皆具備辨識與避免解釋非預期負面影響的工具。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。