[论文解读] TED: Teaching AI to Explain its Decisions
本文提出了TED(Teaching Explanations for Decisions)框架,通过从决策与解释配对的标注样本中学习,训练机器学习模型联合预测决策和人类可理解的解释。与模型内省方法不同,TED使解释与最终用户的认知复杂度和领域知识保持一致,在两个真实世界示例中实现了高预测准确率,且未牺牲性能。
Artificial intelligence systems are being increasingly deployed due to their potential to increase the efficiency, scale, consistency, fairness, and accuracy of decisions. However, as many of these systems are opaque in their operation, there is a growing demand for such systems to provide explanations for their decisions. Conventional approaches to this problem attempt to expose or discover the inner workings of a machine learning model with the hope that the resulting explanations will be meaningful to the consumer. In contrast, this paper suggests a new approach to this problem. It introduces a simple, practical framework, called Teaching Explanations for Decisions (TED), that provides meaningful explanations that match the mental model of the consumer. We illustrate the generality and effectiveness of this approach with two different examples, resulting in highly accurate explanations with no loss of prediction accuracy for these two examples.
研究动机与目标
- 应对社会和监管层面日益增长的需求,即AI系统需为其决策提供‘有意义的信息’,特别是在高风险领域。
- 克服模型内省方法的局限性,后者暴露的是内部模型机制,通常对非专家用户难以理解。
- 开发一种实用且可泛化的框架,生成针对最终用户认知复杂度和领域理解水平量身定制的解释。
- 确保解释生成不会损害底层机器学习模型的预测准确率。
- 通过解耦解释格式与模型架构,并支持多种解释类型,实现可扩展且灵活的解释生成。
提出的方法
- 在数据集中训练联合分类器,其中每个样本包含输入特征(X)、决策标签(Y)和人工提供的解释(E),形成联合预测任务(Y, E)。
- 使用类别标签(Y)和解释选项(E)的笛卡尔积,构建统一的多分类分类问题以进行训练。
- 采用任意标准监督学习算法(例如随机森林、神经网络)学习从输入X到决策Y和解释E的联合映射。
- 允许解释以任意格式呈现——文本、符号或结构化形式——前提是其可枚举且语义上互不相同。
- 通过为同一决策支持多种解释变体,实现解释个性化,以适应不同专业水平的用户。
- 利用词嵌入或领域特定语言(DSL)等技术,管理解释多样性并提升相似解释之间的泛化能力。
实验结果
研究问题
- RQ1AI系统如何生成不仅准确,而且对非专家用户有意义且易于理解的解释?
- RQ2能否训练机器学习模型,使其生成的解释与目标受众的认知复杂度和领域知识相匹配?
- RQ3与传统的模型-解释分离方法相比,联合训练决策与解释对模型预测准确率有何影响?
- RQ4如何在不同用户画像和应用领域之间高效、可扩展地生成解释?
- RQ5当缺乏完整的人工标注解释时,可采用哪些策略来构建或丰富解释数据集?
主要发现
- TED框架成功生成了与最终用户心理模型高度一致的解释,提升了信任度和可解释性,且未降低预测准确率。
- 在两个真实世界示例中,联合预测模型在决策和解释生成方面均实现了高准确率,性能与标准模型相比无任何下降。
- 该方法展现出良好的通用性和简洁性,在不同领域和解释格式(包括自由文本和结构化解释)中均表现有效。
- 该框架通过支持同一决策的多种解释变体,实现了个性化,适用于不同专业水平的用户。
- 联合学习的笛卡尔积方法在实践中可有效扩展,即使在解释选项数量庞大的情况下,仍保持计算可行性。
- 未来可扩展方向如使用外部知识源、少样本学习或主动学习,有助于减轻解释数据收集的标注负担。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。