Skip to main content
QUICK REVIEW

[논문 리뷰] NODE-GAM: Neural Generalized Additive Model for Interpretable Deep Learning

Chun‐Hao Chang, Rich Caruana|arXiv (Cornell University)|2021. 06. 03.
Explainable Artificial Intelligence (XAI)참고 문헌 27인용 수 14
한 줄 요약

이 논문은 해석 가능성과 딥러닝의 확장성 및 성능을 결합한 미분 가능한 신경 일반화 가산 모델인 NODE-GAM과 NODE-GAM2를 제안한다. 새로운 게이팅 메커니즘을 통해 NODE 아키텍처를 변형함으로써, 엔드 투 엔드 학습, 자동 특성 선택, 그리고 자기지도 사전학습이 가능해지며, 이는 표본 데이터에서 최신 기술 성능을 달성하면서도 해석 가능하고 대규모 데이터셋에 대해도 확장 가능한 성능을 보인다.

ABSTRACT

Deployment of machine learning models in real high-risk settings (e.g. healthcare) often depends not only on the model's accuracy but also on its fairness, robustness, and interpretability. Generalized Additive Models (GAMs) are a class of interpretable models with a long history of use in these high-risk domains, but they lack desirable features of deep learning such as differentiability and scalability. In this work, we propose a neural GAM (NODE-GAM) and neural GA$^2$M (NODE-GA$^2$M) that scale well and perform better than other GAMs on large datasets, while remaining interpretable compared to other ensemble and deep learning models. We demonstrate that our models find interesting patterns in the data. Lastly, we show that we improve model accuracy via self-supervised pre-training, an improvement that is not possible for non-differentiable GAMs.

연구 동기 및 목표

  • 대규모 표본 데이터셋에서 성능을 향상시키면서도 해석 가능성을 유지하는, 일반화 가산 모델(GAMs)의 미분 가능한 확장 가능한 딥러닝 버전을 개발하는 것.
  • 비미분 가능한 GAMs의 한계(예: GPU 최적화 불가, 자기지도 사전학습 기능 부족)를 해결하기 위해, 딥러닝 프레임워크에 통합함으로써 이를 해결하는 것.
  • 기존 방법에서 사용하는 이중 단계 학습 또는 앙상블 기법이 필요로 하지 않는, 역전파를 통한 자동 주요 및 쌍차 상호작용 특성 선택을 가능하게 하는 것.
  • 제안된 모델이 의미 있는 데이터 패턴을 발견하고, 특히 저표본 데이터 환경에서 기존의 GAMs 및 딥러닝 모델보다 정확도에서 뛰어난 성능을 보임을 입증하는 것.

제안 방법

  • Popov 등(2019)이 제안한 미분 가능한 트리 기반 아키텍처인 NODE를 변형하여, 가산적 구조를 유지함으로써 해석 가능성을 보존하는 신경 GAM(NODE-GAM)과 신경 GA2M(NODE-GAM2)를 구축하는 것.
  • 높은 차수의 특성 상호작용을 점진적으로 억제하는 새로운 게이팅 메커니즘을 도입하여, 엔드 투 엔드 학습 중에 주요 및 쌍차 특성 선택을 자동으로 수행하는 것.
  • 라벨이 부족한 경우 성능 향상을 위해, 라벨이 있는 데이터로의 피니튜닝 이전에 마스킹된 특성 예측 작업을 통해 자기지도 사전학습을 구현하는 것.
  • 기존의 NIT나 NAM과 같이 반복적 학습 또는 모델 앙상블이 필요한 방법들과는 달리, 공유된 임bedding 레이어와 최종 선형 헤드를 사용하는 단일 단계 학습 프로세스를 적용하는 것.
  • GPU 기반 배치 학습을 통한 기울기 기반 최적화를 통해, 비미분 가능한 GAMs에 비해 더 빠른 수렴과 대규모 데이터셋에 대한 확장성을 확보하는 것.
  • 사전학습 단계에서 어텐션 기반 마스킹과 재구성 목표 함수를 활용하여, 피니튜닝 전에 강력한 표현을 학습하는 것.

실험 결과

연구 질문

  • RQ1대규모 표본 데이터셋에서 최신 기술 성능을 달성하면서도 GAMs의 해석 가능성을 유지할 수 있는, 미분 가능한 딥러닝 아키텍처를 설계할 수 있는가?
  • RQ2라벨이 부족한 환경에서 자기지도 사전학습이 해석 가능한 모델의 성능을 향상시킬 수 있으며, 이는 미분 가능한 GAM 프레임워크 내에서 달성 가능한가?
  • RQ3제안된 모델이 역전파를 통해 주요 및 쌍차 상호작용 특성 상호작용을 자동으로 선택할 수 있는가? 이는 외부 선택 알고리즘 또는 앙상블 방법이 필요로 하지 않는다는 것을 의미한다.
  • RQ4의료와 같은 고위험 분야에서, NODE-GAM과 NODE-GAM2의 형태 함수는 전통적인 GAMs의 형태 함수와 비교해 의미 있는 데이터 패턴을 어떻게 드러내는가?

주요 결과

  • 자기지도 사전학습을 적용한 NODE-GAM은 7개 데이터셋 중 6개에서 사전학습되지 않은 버전보다 우수한 성능을 보였으며, MIMIC2에서는 6%의 상대적 향상과 Churn에서는 최대 10%의 향상을 기록했다.
  • 자기지도 사전학습을 적용한 NODE-GAM은 6개 데이터셋 중 3개(Churn, MIMIC2, Credit)에서 EBM보다 뛰어난 성능을 보였으며, 이는 저표본 환경에서 사전학습의 이점을 입증한다.
  • NODE-GAM과 NODE-GAM2는 더 큰 데이터셋에서 다른 GAMs보다 뛰어난 성능을 보였으며, 스퍼인 기반 및 트리 기반 GAMs에 비해 더 뛰어난 확장성과 정확도를 확보했다.
  • 기존 연구에서 임상적 및 도메인 전문 분석을 통해 검증된 바와 같이, 형태 함수를 통해 모델은 해석 가능한 의미 있는 데이터 패턴을 발견한다.
  • 제안된 아키텍처는 기울기 기반 프루닝을 통해 자동 특성 선택을 가능하게 하여, 트리 기반 GAMs에서 사용되는 후처리 선택 알고리즘이 필요로 하지 않는다는 점에서 유의미하다.
  • 모델는 딥 네URAL 네트워크 수준의 성능를 달성하면서도, 가산적 및 가산-상호작용 구조를 통해 전체적인 해석 가능성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.