Skip to main content
QUICK REVIEW

[论文解读] Is explainable AI a race against model complexity?

Advait Sarkar|arXiv (Cornell University)|May 17, 2022
Explainable Artificial Intelligence (XAI)被引用 9
一句话总结

本文认为,可解释人工智能本质上是一场与模型复杂性日益增长的赛跑,因为更大的模型需要在解释中进行越来越严重的有损压缩,导致完全透明化变得不可行。尽管解释无法跟上模型复杂性的步伐,本文提出了务实的、以用户为中心的策略——如交互式设计、元模型和用户赋权——以应对后可解释性时代,在系统固有不透明性的情况下仍能维持信任。

ABSTRACT

Explaining the behaviour of intelligent systems will get increasingly and perhaps intractably challenging as models grow in size and complexity. We may not be able to expect an explanation for every prediction made by a brain-scale model, nor can we expect explanations to remain objective or apolitical. Our functionalist understanding of these models is of less advantage than we might assume. Models precede explanations, and can be useful even when both model and explanation are incorrect. Explainability may never win the race against complexity, but this is less problematic than it seems.

研究动机与目标

  • 调查人工智能模型的日益复杂化是否使可解释性本质上无法实现。
  • 分析随着模型规模向类脑复杂度发展,现有解释方法的局限性。
  • 探讨人类推理与认知限制如何指导有效人工智能解释的设计。
  • 评估法律、技术和交互式方法在人工智能可解释性方面的可行性与不足。
  • 提出从追求完美解释转向设计支持用户自主性与实际信任的系统,以应对高风险人工智能应用。

提出的方法

  • 分析大规模神经网络解释的理论与实践障碍,重点关注解释中的有损压缩问题。
  • 将人类解释过程与人工智能解释进行类比,强调认知限制以及抽象化的作用。
  • 回顾现有解释技术,如显著性图、反事实解释和注意力可视化,在图像与自然语言处理任务中的应用。
  • 审视如GDPR中“解释权”的立法框架及其在概念与实践上的不足。
  • 提出替代策略,包括用于解释的元模型、终端用户编程和交互式设计,以增强用户能力。
  • 应用库布勒-罗丝哀伤模型来框架社会与用户对人工智能不透明性的反应,表明接受与适应比完全可解释性更现实。

实验结果

研究问题

  • RQ1随着模型规模的增长,对日益复杂的AI模型的解释能否保持意义、准确与实用?
  • RQ2认知与感知限制在多大程度上制约了AI解释的有效性?
  • RQ3当前如GDPR中“解释权”的法律框架在多大程度上解决了或未能解决人工智能可解释性的核心挑战?
  • RQ4当由于模型复杂性导致完美解释不可行时,可采用哪些替代策略?
  • RQ5在缺乏完全透明性的情况下,如何赋能用户与AI系统进行交互并塑造其行为?

主要发现

  • 随着模型复杂性的增加,解释必须执行更大的有损压缩,导致解释过程中不可避免地损失细节与细微之处。
  • 当前的解释方法,如显著性图和注意力可视化,本身就是有损压缩形式,无法完整呈现大型模型的决策过程。
  • GDPR中“解释权”的概念具有前瞻性,但实践上较薄弱,因其并未保证提供有意义或可操作的解释。
  • 法律与技术层面的解释方法往往未能触及根本问题:模型复杂性与人类认知极限之间的根本不相容性。
  • 务实的替代方案——如交互式设计、终端用户编程和元模型——比追求完美解释提供了更可行的前进路径。
  • 本文结论认为,尽管可解释人工智能可能永远无法在与复杂性的赛跑中‘获胜’,但社会可通过用户赋权与后可解释性策略实现适应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。