[论文解读] Semantic Explanations of Predictions
本文提出一种事后解释方法,通过提取靠近决策边界的代表性训练数据点,利用本体论推导出领域特定的概念,并对统一解释和对比解释进行排序,从而生成以人类为中心、语义丰富的解释。其核心贡献是一个将语义推理与模型预测相结合的框架,能够生成基于现实世界知识、信息丰富、具有对比性且与用户相关的解释。
The main objective of explanations is to transmit knowledge to humans. This work proposes to construct informative explanations for predictions made from machine learning models. Motivated by the observations from social sciences, our approach selects data points from the training sample that exhibit special characteristics crucial for explanation, for instance, ones contrastive to the classification prediction and ones representative of the models. Subsequently, semantic concepts are derived from the selected data points through the use of domain ontologies. These concepts are filtered and ranked to produce informative explanations that improves human understanding. The main features of our approach are that (1) knowledge about explanations is captured in the form of ontological concepts, (2) explanations include contrastive evidences in addition to normal evidences, and (3) explanations are user relevant.
研究动机与目标
- 为解决机器学习模型在医疗、金融等高风险领域中可解释性不足的问题。
- 通过生成语义上有意义且上下文相关的解释,提升人类对模型预测的理解。
- 基于社会科学研究中关于人类解释行为的见解,引入对比性推理——即解释为何样本被分类为 y 而非 y′。
- 开发一个框架,利用领域本体论将原始数据点转化为可解释的语义概念,以支持解释生成。
- 通过允许用户根据感知相关性从排序后的解释集中进行选择,实现个性化、与用户相关的解释。
提出的方法
- 选取位于决策边界附近且处于测试样本局部邻域内的代表性训练数据点,以捕捉显著特征。
- 利用领域特定的本体论从所选数据点中提取并编码语义概念,将原始特征转化为人类可理解的术语。
- 计算统一解释,即代表性数据集中正样本共享的语义概念集合。
- 通过识别代表性数据集中正样本组与负样本组之间的语义差异,推导出对比解释。
- 利用语义相似度与距离阈值对解释进行排序,优先选择最具有信息量和相关性的概念。
- 采用一种排序策略,优先选择与对比概念最相似的概念;当缺乏强相似性时,启用备用排序顺序。
实验结果
研究问题
- RQ1如何通过从训练数据中提取的语义概念,使机器学习预测的解释更有利于人类理解?
- RQ2对比解释(即回答“为何是 y 而非 y′?”)在提升用户对模型决策理解方面发挥何种作用?
- RQ3如何有效利用领域本体论,将原始数据特征转化为可解释且有意义的语义概念用于解释?
- RQ4在不完全依赖模型概率排序的前提下,如何将用户相关性与个性化整合进事后解释系统?
- RQ5如何通过语义推理结合统一与对比证据,优化解释的信息量?
主要发现
- 该方法成功生成了统一与对比的语义解释,识别出如 'TheSilentGeneration' 和 'OperationIn1960s' 等高度相关的关键词,显著提升预测可解释性。
- 对比解释被证明比统一解释更具信息量,例如 'TheGIGeneration' 和 'OperationIn1950s' 等概念有效突出了影响分类结果的差异。
- 语义相似度与距离阈值(σ)的结合,实现了对解释的有效排序,确保最相关概念优先输出。
- 最终解释集的排序中,'TheSilentGeneration' 在对比解释中位列第一,反映出其强大的判别能力。
- 该框架表明,语义提升程度以及训练数据中概念的频率,对解释中概念权重分配具有实质性贡献。
- 该方法可通过将所有预测标签视为正例,并针对每个负类计算对比证据,实现多标签扩展;同时支持用户指定的不相关类别剪枝。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。