Skip to main content
QUICK REVIEW

[논문 리뷰] Distilling a Deep Neural Network into a Takagi-Sugeno-Kang Fuzzy Inference System

Xiangming Gu, Cheng Xiang|arXiv (Cornell University)|2020. 10. 10.
Neural Networks and Applications참고 문헌 21인용 수 11
한 줄 요약

이 논문은 분류를 위한 더 해석 가능한 규칙 기반 모델을 만들기 위해 심층 신경망(DNN)에서 타카기-스우에노-칸구(TSK) 퍼지 추론 시스템(FIS)으로 지식을 희석시키는 방법을 제안한다. 수정된 KD 방법을 적용하고 PCA를 사용해 특징을 추출함으로써, 기준 모델보다 높은 정확도를 달성하면서도 퍼지 규칙를 통해 투명한 의사결정 설명을 가능하게 한다.

ABSTRACT

Deep neural networks (DNNs) demonstrate great success in classification tasks. However, they act as black boxes and we don't know how they make decisions in a particular classification task. To this end, we propose to distill the knowledge from a DNN into a fuzzy inference system (FIS), which is Takagi-Sugeno-Kang (TSK)-type in this paper. The model has the capability to express the knowledge acquired by a DNN based on fuzzy rules, thus explaining a particular decision much easier. Knowledge distillation (KD) is applied to create a TSK-type FIS that generalizes better than one directly from the training data, which is guaranteed through experiments in this paper. To further improve the performances, we modify the baseline method of KD and obtain good results.

연구 동기 및 목표

  • 심층 신경망(DNN)의 해석 불가능성 문제를 해결하기 위해 DNN를 규칙 기반의 설명 가능한 모델로 변환하는 것.
  • 지식 희석(KD)을 활용해 DNN의 지식을 더 나은 일반화 능력을 갖춘 TSK 유형의 퍼지 추론 시스템(FIS)으로 이전하는 것.
  • 인간이 이해할 수 있는 퍼지 규칙를 통해 DNN의 의사결정을 표현함으로써 모델의 해석 가능성 향상.
  • TSK-FIS 아키텍처에 맞게 조정된 수정된 KD 방법을 통해 학생 FIS 모델의 성능과 일반화 능력을 향상시키는 것.
  • 기본 데이터셋(MNIST, FashionMNIST)에서 제안된 방법을 검증하고 의사결정 트리 및 CNN+TSK 하이브리드 모델과의 비교를 수행하는 것.

제안 방법

  • 이 방법은 사전에 훈련된 DNN(선생 모델)에서 TSK 유형의 FIS(학생 모델)로 지식을 희석시키며, 학생 모델이 DNN의 출력 확률을 모방하도록 학습한다.
  • 입력 특징은 해석 가능성 향상과 차원 축소를 위해 주성분 분석(PCA)을 통해 감소된 후 FIS에 입력된다.
  • 학생 FIS는 PCA 변환된 특징을 기반으로 온라인으로 훈련되며, 선수 모델은 원본 데이터에서 사전 훈련되어, 이는 다중 모odal 지식 희석을 모방한다.
  • 선생 모델과 학생 모델 간의 일반화 갭을 고려하기 위해 수정된 지식 희석 방법을 제안하여 성능 향상.
  • TSK-FIS의 각 퍼지 규칙는 전제(가우시안 소속도 함수)와 결과(선형 출력)로 구성되며, 규칙의 활성도는 곱셈 T-노름을 사용해 계산되고 정규화된다.
  • 최종 예측은 정규화된 활성도를 가중 평균으로 사용한 규칙 출력의 평균을 취한 후 소프트맥스 변환을 통해 확률 출력을 도출한다.

실험 결과

연구 질문

  • RQ1DNN에서 TSK 유형의 FIS로 의사결정 지식을 효과적으로 희석시킬 수 있는가? 이 과정에서 정확도는 유지되고 해석 가능성은 향상되는가?
  • RQ2DNN에서 희석된 TSK-FIS의 성능는 표준 기준 데이터셋에서 지식 희석을 적용한 의사결정 트리와 비교해 어떻게 되는가?
  • RQ3입력 특징 축소를 위해 PCA를 사용할 경우, 희석된 TSK-FIS의 해석 가능성과 성능에 어떤 영향을 미치는가?
  • RQ4제안된 수정된 지식 희석 방법은 기준 KD 방법에 비해 TSK-FIS의 일반화 능력과 정확도를 향상시키는가?
  • RQ5TSK-FIS 모델은 규칙 기반 추론을 통해 인간이 이해할 수 있는 의미 있는 분류 결정 설명을 제공할 수 있는가?

주요 결과

  • 제안된 방법은 MNIST에서 97.91%의 정확도, FashionMNIST에서 88.49%의 정확도를 달성하여, DT+KD 기준 모델(96.76%)과 CNN+TSK 모델(97.52% 및 84.50%)을 모두 초월했다.
  • 수정된 지식 희석 방법은 MNIST에서 기준 KD 대비 1.6% 향상된 정확도를 기록했으며, FashionMNIST에서는 1.5% 향상되었다. 기준 KD는 각각 1.2%와 0.8% 향상되었다.
  • 학생 모델는 총 12,000개의 학습 가능한 파라미터만 사용했으며, DNN 선생 모델의 120,000개(MNIST) 및 1,694,000개(FashionMNIST)에 비해 현저히 적어 저장 및 추론 비용을 감소시켰다.
  • 학생 모델은 CPU에서 MNIST 기준으로 선생 모델 대비 16배 더 빠른 속도로 훈련되었으며(에포크당 3.3초 대비 53초), 훈련 효율성이 뛰어나다는 것을 보여주었다.
  • 모델은 투명한 의사결정 설명을 제공한다: 규칙 활성도와 결과 점수를 통해 특징 기여도와 카테고리 유사성을 파악할 수 있다(예: 스니커즈, 샌들, 앵클 부츠는 규칙 출력에서 유사성을 보인다).
  • 규칙 활성도 시각화 결과, 모델이 올바른 클래스(스니커즈)에 대해 가장 높은 활성도와 점수를 기록함으로써, 규칙 기반 시스템의 해석 가능성은 정당화되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.