Skip to main content
QUICK REVIEW

[논문 리뷰] E2E-FS: An End-to-End Feature Selection Method for Neural Networks

Brais Cancela, Verónica Bolón‐Canedo|arXiv (Cornell University)|2020. 12. 14.
Fault Detection and Control Systems인용 수 4
한 줄 요약

E2E-FS는 선택된 기능의 최대 수에 하드 제약 조건을 부과함으로써 라소 유사 정규화의 정확성과 필터 방법의 해석 가능성의 장점을 결합한 신경망을 위한 새로운 엔드 투 엔드 기능 선택 방법이다. 이는 기울기 하강법을 사용하여 모델 훈련과 기능 선택을 동시에 최적화함으로써 다양한 데이터 세트(이미지 및 마이크로어레이 데이터 포함)에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Classic embedded feature selection algorithms are often divided in two large groups: tree-based algorithms and lasso variants. Both approaches are focused in different aspects: while the tree-based algorithms provide a clear explanation about which variables are being used to trigger a certain output, lasso-like approaches sacrifice a detailed explanation in favor of increasing its accuracy. In this paper, we present a novel embedded feature selection algorithm, called End-to-End Feature Selection (E2E-FS), that aims to provide both accuracy and explainability in a clever way. Despite having non-convex regularization terms, our algorithm, similar to the lasso approach, is solved with gradient descent techniques, introducing some restrictions that force the model to specifically select a maximum number of features that are going to be used subsequently by the classifier. Although these are hard restrictions, the experimental results obtained show that this algorithm can be used with any learning model that is trained using a gradient descent algorithm.

연구 동기 및 목표

  • 통합 방법에서 기능 선택 정확성과 모델의 해석 가능성 간의 상충 관계를 해결하기 위해.
  • 높은 성능를 유지하면서 선택된 기능의 수를 정밀하게 제어할 수 있도록 하기 위해.
  • 기울기 하강법을 통해 훈련되는 모든 모델(딥 신경망 포함)과 호환 가능한 방법을 개발하기 위해.
  • SVM-RFE나 SFS와 같은 반복적 방법의 다중 모델 재훈련을 피하기 때문에, 계산 비용을 감소시키기 위해.
  • 고차원 기계 학습 작업에서 기능 선택을 위한 통합적이고 효율적이며 확장 가능한 솔루션을 제공하기 위해.

제안 방법

  • 기능 선택을 이진 마스크 벡터 𝛾 ∈ {0,1}^F가 기능을 선택하는 제약 최적화 문제로 공식화하며, ||𝛾||₁ ≤ M 조건을 통해 최대 M개의 기능 선택을 강제한다.
  • 기울기 기반 최적화를 가능하게 하기 위해 소프트플러스 함수를 사용한 이진 제약 조건의 미분 가능 근사값을 도입한다.
  • 손실 함수는 모델의 예측 오차와 𝛾의 희박성(스퍼스리티)를 장려하는 비볼록 정규화 항을 조합한다.
  • 표준 최적화 기법(예: Adam, SGD)을 사용하여 엔드 투 엔드로 학습하며, 최종 마스크 𝛾를 사용해 상위 M개 기능을 선택한다.
  • 완전 연결 네트워크 및 컨volutional 신경망(CNNs)을 포함한 모든 미분 가능한 모델과 호환된다.
  • 이중 단계 훈련 과정을 사용한다: 먼저 마스크의 안정화를 위한 웜업 단계를 거치고, 이후 고정된 하이퍼파rameter(예: 가중치 감소 5e-4, 70 에포크)로 공동 훈련한다.

실험 결과

연구 질문

  • RQ1단일 단계, 엔드 투 엔드 방법이 신경망 훈련에서 높은 정확성과 제어된 기능 수를 동시에 달성할 수 있는가?
  • RQ2계산 효율성과 성능 측면에서 제안된 방법이 반복적 또는 반복적인 기능 선택 기법보다 어떻게 비교되는가?
  • RQ3기능 수에 하드 상한선을 적용함으로써 일반화 성능나 모델의 해석 가능성은 향상되나 정확도는 손상되지 않는가?
  • RQ4이 방법은 이미지 및 고차원 생물학적 데이터를 포함한 다양한 데이터 유형에 효과적으로 적용될 수 있는가?
  • RQ5이진 마스크의 미분 가능 근사값이 수렴성과 기능 선택의 안정성에 어떤 영향을 미치는가?

주요 결과

  • E2E-FS-Soft는 Fashion-MNIST, CIFAR-10, CIFAR-100에서 최신 기술 수준의 정확도를 달성하여, 모든 기능 수에서 DFS, SFS, iSFS, SFS+DFS를 모두 앞서갔다.
  • CIFAR-10에서 E2E-FS-Soft는 392개 기능으로 93.68%의 정확도를 기록했으며, 다음으로 우수한 성능를 보인 SFS+DFS(92.59%)보다 1.3% 높았다.
  • CIFAR-100에서 E2E-FS-Soft는 1536개 기능으로 70.30%의 정확도를 기록했고, DFS(67.42%)와 SFS+DFS(64.94%)를 5% 이상 앞섰다.
  • 훈련 시간은 CIFAR-100에서 약 4180초로 단축되었으며, iSFS(~39시간)와 SFS+DFS(7260초)보다 빠르게 성능을 냈다.
  • 낮은 기능 수에서 성능 향상이 가장 두드러졌다: CIFAR-100에서 153개 기능만 선택했을 때 29% 향상된 성능를 기록했다.
  • 이 방법은 MNIST와 같은 이진 데이터셋에서는 성능이 DFS에 뒤져, 데이터 유형의 특성에 민감함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.