[论文解读] Why Interpretability in Machine Learning? An Answer Using Distributed Detection and Data Fusion Theory
本文主张在人机决策系统中,可解释的机器学习模型优于黑箱模型,其理论基础是将人机协作建模为串联式数据融合系统。基于群体设定下的分布式检测理论,证明了多级量化(代表可解释模型)的误码率低于二值量化(代表黑箱模型),从而在融合的人机决策中展现出可解释性带来的理论性能优势。
As artificial intelligence is increasingly affecting all parts of society and life, there is growing recognition that human interpretability of machine learning models is important. It is often argued that accuracy or other similar generalization performance metrics must be sacrificed in order to gain interpretability. Such arguments, however, fail to acknowledge that the overall decision-making system is composed of two entities: the learned model and a human who fuses together model outputs with his or her own information. As such, the relevant performance criteria should be for the entire system, not just for the machine learning component. In this work, we characterize the performance of such two-node tandem data fusion systems using the theory of distributed detection. In doing so, we work in the population setting and model interpretable learned models as multi-level quantizers. We prove that under our abstraction, the overall system of a human with an interpretable classifier outperforms one with a black box classifier.
研究动机与目标
- 为应对AI系统中日益增长的可解释性需求,重新评估性能指标,超越模型准确率本身。
- 将人机决策过程建模为两节点串联式数据融合系统,其中人类融合来自机器学习模型的信息。
- 探究可解释模型(抽象为多级量化器)是否相比黑箱模型能提升整体系统的决策准确率。
- 基于群体设定下的分布式检测与数据融合理论,为可解释性建立理论基础。
- 证明在人机协作中,应以整体系统性能而非仅模型准确率为性能评估标准。
提出的方法
- 将人机决策系统建模为两节点串联传感器网络:机器从数据中学习,并将量化输出传送给人类。
- 将可解释模型抽象为似然比统计量的多级量化器,而将黑箱模型建模为二值量化器。
- 采用群体设定以访问真实数据分布,从而在无有限样本偏差的情况下分析渐近性能。
- 应用切尔诺夫信息作为性能度量,比较不同量化级别下的系统级误码率。
- 利用分布式检测理论(如Varshney, 1997;Zhu & Chen, 2013)的结果,证明对充分统计量进行量化可保持最优推断性能。
- 证明多于两级的量化系统可获得更高的切尔诺夫信息,意味着最终人类决策的贝叶斯误码率更低。
实验结果
研究问题
- RQ1与黑箱模型相比,使用可解释的机器学习模型是否能提升人机决策系统的整体性能?
- RQ2在人机串联融合架构中,模型输出的量化级别数量如何影响系统级误码率?
- RQ3能否利用分布式检测理论正式刻画可解释模型在人机协作中的性能优势?
- RQ4在人类与模型观测条件独立的假设下,可解释性带来的性能增益是否依然稳健?
- RQ5群体设定如何影响可解释模型与黑箱模型之间理论比较的有效性?
主要发现
- 将可解释模型建模为多级量化器时,其在类别条件分布之间的切尔诺夫信息高于采用二值量化黑箱模型的情况。
- 更高的切尔诺夫信息意味着整体人机系统贝叶斯误码率更低,从而证明可解释模型能带来更优的系统级性能。
- 该理论优势在人类与机器观测条件独立的假设下成立,且推测可推广至依赖情形。
- 群体设定使得对充分统计量与原始特征进行量化等价,确保性能比较有效且不受有限样本效应影响。
- 分析表明,可解释性带来的性能增益并非源于模型本身更高的准确率,而是源于更丰富的信息传递,使人类能更有效地进行信息融合。
- 结果表明,当人类接收到多级输出时,其推理与信息整合能力得到增强,即使模型内在准确率相同。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。