[论文解读] RL-LIM: Reinforcement Learning-based Locally Interpretable Modeling
RL-LIM 提出了一种基于强化学习的方法,通过选择一组最小的代表性样本,并将黑箱模型的预测知识蒸馏到一个低容量、人类可读的模型中,从而构建局部可解释模型。该方法在预测性能上几乎与黑箱模型持平,同时在保真度和可解释性方面显著优于当前最先进方法,得益于基于奖励的样本选择机制。
Understanding black-box machine learning models is important towards their widespread adoption. However, developing globally interpretable models that explain the behavior of the entire model is challenging. An alternative approach is to explain black-box models through explaining individual prediction using a locally interpretable model. In this paper, we propose a novel method for locally interpretable modeling - Reinforcement Learning-based Locally Interpretable Modeling (RL-LIM). RL-LIM employs reinforcement learning to select a small number of samples and distill the black-box model prediction into a low-capacity locally interpretable model. Training is guided with a reward that is obtained directly by measuring agreement of the predictions from the locally interpretable model with the black-box model. RL-LIM near-matches the overall prediction performance of black-box models while yielding human-like interpretability, and significantly outperforms state of the art locally interpretable models in terms of overall prediction performance and fidelity.
研究动机与目标
- 为了解决以准确且人类可理解的方式解释复杂黑箱机器学习模型的挑战。
- 开发一种方法,在最小化数据量的同时生成局部可解释模型,同时保留原始黑箱模型的预测性能。
- 通过强化学习提升现有局部可解释模型,在预测保真度和模型可解释性两方面实现改进。
- 实现模型无关的局部解释,兼具高效性与对黑箱模型行为的忠实性。
提出的方法
- 使用强化学习选择一小部分代表性训练样本,以最好地捕捉黑箱模型在特定实例附近的预测行为。
- 在所选样本上训练一个低容量、可解释的模型,以局部近似黑箱模型的预测结果。
- 训练过程由一个奖励信号引导,该信号衡量可解释模型预测结果与黑箱模型输出之间的吻合程度。
- 强化学习框架中的策略网络学习优化样本选择,以实现最大保真度与最小复杂度。
- 该方法具有模型无关性,无需对黑箱模型的架构进行任何修改即可应用。
实验结果
研究问题
- RQ1强化学习能否有效识别用于局部模型蒸馏的最小代表性样本集?
- RQ2在预测保真度和性能方面,RL-LIM 与当前最先进局部可解释模型相比表现如何?
- RQ3通过强化学习训练的局部可解释模型在多大程度上能匹配原始黑箱模型的预测准确性?
- RQ4基于奖励的样本选择过程是否能生成更具人类可读性且更忠实的局部解释?
主要发现
- RL-LIM 在局部预测上实现的性能几乎与原始黑箱模型无法区分。
- 该方法在保真度方面显著优于当前最先进局部可解释模型。
- RL-LIM 生成的局部可解释模型既紧凑又高度忠实,支持人类可读的解释。
- 基于强化学习的样本选择过程能有效识别出能以最少数据量保留预测准确性的代表性实例。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。