Skip to main content
QUICK REVIEW

[论文解读] Distilling a Deep Neural Network into a Takagi-Sugeno-Kang Fuzzy Inference System

Xiangming Gu, Cheng Xiang|arXiv (Cornell University)|Oct 10, 2020
Neural Networks and Applications参考文献 21被引用 11
一句话总结

本文提出将深度神经网络(DNN)的知识蒸馏到Takagi-Sugeno-Kang(TSK)模糊推理系统(FIS)中,以构建一种更具可解释性的、基于规则的分类模型。通过应用改进的KD方法进行知识蒸馏,并结合主成分分析(PCA)进行特征提取,该方法在保持更高准确率的同时,通过模糊规则实现了透明的决策解释。

ABSTRACT

Deep neural networks (DNNs) demonstrate great success in classification tasks. However, they act as black boxes and we don't know how they make decisions in a particular classification task. To this end, we propose to distill the knowledge from a DNN into a fuzzy inference system (FIS), which is Takagi-Sugeno-Kang (TSK)-type in this paper. The model has the capability to express the knowledge acquired by a DNN based on fuzzy rules, thus explaining a particular decision much easier. Knowledge distillation (KD) is applied to create a TSK-type FIS that generalizes better than one directly from the training data, which is guaranteed through experiments in this paper. To further improve the performances, we modify the baseline method of KD and obtain good results.

研究动机与目标

  • 为解决深度神经网络(DNN)缺乏可解释性的问题,将DNN转化为基于规则的可解释模型。
  • 利用知识蒸馏(KD)将DNN的知识迁移至TSK型模糊推理系统(FIS),以提升泛化能力。
  • 通过人类可读的模糊规则表达DNN的决策,提升模型可解释性。
  • 通过针对TSK-FIS架构定制的改进KD方法,提升学生FIS模型的性能与泛化能力。
  • 在基准数据集(MNIST、FashionMNIST)上验证该方法,并与现有可解释模型(如决策树和CNN+TSK混合模型)进行比较。

提出的方法

  • 该方法使用知识蒸馏,将预训练DNN(教师模型)的知识迁移至TSK型FIS(学生模型),使学生模型学习模仿DNN的输出概率。
  • 通过主成分分析(PCA)对输入特征进行降维,以提升可解释性并降低维度,再输入FIS。
  • 学生FIS在PCA变换后的特征上在线训练,而教师模型在原始数据上预训练,模拟跨模态知识蒸馏。
  • 提出一种改进的知识蒸馏方法,以弥补教师与学生模型之间的泛化差距,从而提升性能。
  • TSK-FIS中的每条模糊规则包含前提部分(高斯隶属函数)和结论部分(线性输出),规则激活强度通过乘积T-范数计算并归一化。
  • 最终预测通过加权平均规则输出并使用归一化激活强度,再经Softmax变换得到概率输出。

实验结果

研究问题

  • RQ1知识蒸馏能否有效将DNN的决策知识迁移至TSK型FIS,同时保持准确率并提升可解释性?
  • RQ2与在标准基准数据集上使用知识蒸馏的决策树相比,从DNN蒸馏得到的TSK-FIS性能如何?
  • RQ3使用PCA进行输入特征降维在多大程度上提升了蒸馏后TSK-FIS的可解释性与性能?
  • RQ4所提出的改进知识蒸馏方法是否相比基线KD方法,提升了TSK-FIS的泛化能力与准确率?
  • RQ5TSK-FIS模型能否通过基于规则的推理,为分类决策提供有意义且人类可理解的解释?

主要发现

  • 所提方法在MNIST上达到97.91%的准确率,在FashionMNIST上达到88.49%,优于DT+KD基线(96.76%)和CNN+TSK模型(97.52%和84.50%)。
  • 与基线KD相比,改进的KD方法使学生模型在MNIST上提升1.6%准确率,在FashionMNIST上提升1.5%;基线KD分别提升1.2%和0.8%。
  • 学生FIS模型仅使用12K个可训练参数,远少于DNN教师模型的120K(MNIST)和169.4万(FashionMNIST),显著降低存储与推理成本。
  • 学生模型在CPU上训练速度比教师模型快16倍(MNIST上每轮3.3秒 vs. 53秒),表明训练效率更高。
  • 该模型提供透明的决策解释:规则激活强度与结论得分可揭示特征贡献及类别相似性(例如,运动鞋、人字拖和及踝靴在规则输出中密切相关)。
  • 规则激活可视化证实,模型正确识别了最相关的特征与规则,且正确类别(运动鞋)的激活强度与得分最高,验证了基于规则系统的可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。