Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Basis Models for Interpretability

Filip Radenović, Abhimanyu Dubey|arXiv (Cornell University)|2022. 05. 27.
Explainable Artificial Intelligence (XAI)인용 수 13
한 줄 요약

이 논문은 공유된 딥 뉴럴 네트워크로 학습된 기저 함수를 사용해 특성 형태 함수를 표현하는 새로운 일반화된 덧셈 모델(GAMs) 가족인 신경 기저 모델(NBM)을 소개한다. 각 특성의 기여도를 소수의 공유 기저 함수의 선형 조합으로 분해함으로써, NBM는 최신 기술 수준의 정확도, 모델 효율성 및 처리량을 달성한다. 기존의 NAMs와 같은 GAMs에 비해 매개변수를 5배에서 50배 감소시키고 처리량을 4배에서 7배 향상시키며, 특히 고차원적이고 희박한 데이터셋에서 뛰어난 성능을 보인다.

ABSTRACT

Due to the widespread use of complex machine learning models in real-world applications, it is becoming critical to explain model predictions. However, these models are typically black-box deep neural networks, explained post-hoc via methods with known faithfulness limitations. Generalized Additive Models (GAMs) are an inherently interpretable class of models that address this limitation by learning a non-linear shape function for each feature separately, followed by a linear model on top. However, these models are typically difficult to train, require numerous parameters, and are difficult to scale. We propose an entirely new subfamily of GAMs that utilizes basis decomposition of shape functions. A small number of basis functions are shared among all features, and are learned jointly for a given task, thus making our model scale much better to large-scale data with high-dimensional features, especially when features are sparse. We propose an architecture denoted as the Neural Basis Model (NBM) which uses a single neural network to learn these bases. On a variety of tabular and image datasets, we demonstrate that for interpretable machine learning, NBMs are the state-of-the-art in accuracy, model size, and, throughput and can easily model all higher-order feature interactions. Source code is available at https://github.com/facebookresearch/nbm-spam.

연구 동기 및 목표

  • 기본적으로 해석 가능한 모델들인 NAMs와 EBMs처럼 각 특성에 대해 고정된 매개변수 수를 요구하는 모델의 확장성과 매개변수 효율성의 한계를 해결하기 위해.
  • 특성 간의 복잡한 상호작용을 효과적으로 모델링하고, 특히 희박한 특성들에 대해 정확하고 해석 가능한 모델링을 가능하게 하기 위해, 특성 간에 공유되는 기저 함수를 학습함으로써.
  • 기본적으로 해석 가능한 GAMs의 특성을 유지하면서, 기저 분해와 딥 러닝을 통해 모델 크기와 추론 시간을 크게 줄이기 위해.
  • GA2Ms나 NA2Ms와 같이 매개변수 수가 제곱 증가하는 문제를 피하면서도 고차원 상호작용을 효율적으로 모델링하기 위해.
  • 딥 러닝 파ip라인에 원활하게 통합될 수 있도록 확장 가능하고, 미분 가능하며 GPU에 적합한 아키텍처를 제공하기 위해.

제안 방법

  • 각 특성의 형태 함수를 소수의 공유 기저 함수의 선형 조합으로 표현하는 새로운 GAM 하위 가족을 제안한다. 이 기저 함수들은 단일 딥 뉴럴 네트워크를 통해 함께 학습된다.
  • 단일 신경망을 사용해 기저 함수를 학습함으로써, GPU에서 미니배치 확률적 경사 하강법을 통한 엔드 투 엔드 학습이 가능하다.
  • 신호 처리 기법(예: 푸리에, 레지오드)에서 영감을 얻은 기저 분해를 활용하지만, 고정된 함수가 아니라 작업에 특화된 방식으로 기저 함수를 학습한다.
  • 추가적인 공유 기저 함수 세트를 도입해 쌍별 상호작용을 모델링함으로써, 선형 매개변수 증가율을 유지하면서 고차원 상호작용을 가능하게 한다.
  • 입력 차원에 대해 기저 수의 로그 수준에서 일반화 오차가 작아지는 것을 보여주기 위해, 라데마처 복잡도를 이용한 일반화 경계를 적용한다.
  • 실험적 위험과 정규화를 조합한 손실 함수를 사용해 적합성과 일반화 능력을 모두 확보하며, 근사 오차에 대한 이론적 보장을 제공한다.

실험 결과

연구 질문

  • RQ1특성 간에 공유되는 기저 함수를 사용하면, 정확도를 유지하면서도 매개변수 수를 줄이고 확장성을 향상시킬 수 있는가?
  • RQ2단일 딥 뉴럴 네트워크가 다양한 특성과 작업에 대해 잘 일반화되는 기저 함수를 효과적으로 학습할 수 있는가?
  • RQ3고차원적이고 희박한 데이터셋에서 NAMs와 EBM과 같은 최신 기술 수준의 GAMs에 비해 NBM 아키텍처의 정확도, 모델 크기, 처리량 측면에서 어떻게 비교되는가?
  • RQ4GA2Ms나 NA2Ms와 같이 매개변수 수가 제곱 증가하는 문제를 피하면서도 고차원 상호작용을 효율적으로 포착할 수 있는가?
  • RQ5학습된, 작업에 특화된 기저 함수를 사용할 경우, 고정된 기저 함수나 독립적인 각 특성 모델에 비해 일반화 능력과 모델의 충실도가 향상되는가?

주요 결과

  • 표준형 및 이미지 데이터셋에서 NBM는 정확도, 모델 크기, 추론 처리량 측면에서 최신 기술 수준의 성능를 달성하며, NAMs와 EBMs를 능가한다.
  • 10개 이상의 특성을 가진 데이터셋에서는 NAMs 대비 매개변수 수를 5배에서 50배까지 감소시켜 확장성 향상을 뚜렷이 보였다.
  • NAMs 대비 처리량을 4배에서 7배 향상시켜 실시간 및 대규모 배포에 적합한 성능를 확보했다.
  • 쌍별 기저 함수로의 확장 덕분에 고차원 상호작용을 효과적으로 포착했으며, GA2Ms나 NA2Ms와 달리 매개변수 수가 선형 증가한다.
  • 이론적 분석 결과, 근사 오차가 기저 수에 따라 지수적으로 감소함을 보여주며, 입력 차원에 비해 기저 수가 로그 수준으로 증가하면 충분한 성능가능성을 보였다.
  • 10만 개 이상의 특성을 가진 희박한 데이터셋에서도 다른 GAMs가 실패하는 상황에서도 NBM는 효과적으로 확장 가능했으며, 산업 규모의 응용에서 실용적인 유용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.