[논문 리뷰] The GatedTabTransformer. An enhanced deep learning architecture for tabular modeling
이 논문은 표준 MLP 헤드를 게이팅된 MLP(gMLP) 블록으로 대체하여 성능을 향상시킨 표형 데이터를 위한 개선된 딥러닝 아키텍처인 GatedTabTransformer를 제안한다. 선형 투영과 공간 게이팅 유닛을 통합함으로써, 이 모델은 세 개의 이진 분류 데이터셋에서 원래 TabTransformer 대비 0.5%에서 1.1% 높은 AUROC를 달성하였으며, 기준 모델 대비 최대 3.1% 향상된 성능을 보였다.
There is an increasing interest in the application of deep learning architectures to tabular data. One of the state-of-the-art solutions is TabTransformer which incorporates an attention mechanism to better track relationships between categorical features and then makes use of a standard MLP to output its final logits. In this paper we propose multiple modifications to the original TabTransformer performing better on binary classification tasks for three separate datasets with more than 1% AUROC gains. Inspired by gated MLP, linear projections are implemented in the MLP block and multiple activation functions are tested. We also evaluate the importance of specific hyper parameters during training.
연구 동기 및 목표
- 표형 데이터의 이진 분류 작업에서 TabTransformer의 성능을 향상시키기 위해.
- 표준 MLP 헤드를 게이팅된 MLP(gMLP)로 교체할 경우 일반화 및 특징 표현 능력 향상 여부를 조사하기 위해.
- 더 나은 모델 수렴과 성능을 위해 학습률, 히든 차원 크기, 활성화 함수 등의 핵심 하이퍼파라미터를 최적화하기 위해.
- 다양한 표형 데이터셋에서 모델의 강건성과 확장성에 영향을 미치는 아키텍처 수정 사항의 영향을 평가하기 위해.
제안 방법
- TabTransformer의 최종 다층 퍼셉트론(MLP) 헤드를 공간 게이팅 유닛을 활용한 게이팅된 MLP(gMLP) 블록으로 교체하여 토큰 간 상호작용을 강화한다.
- gMLP 블록 내에서 채널 차원을 따라 선형 투영(U 및 V)을 구현하여 특징 변환 능력을 향상시킨다.
- 공간 게이팅 유닛을 s(Z) = Z * f_{W,b}(Z)로 정의하며, 여기서 f_{W,b}(Z) = WZ + b로 하여 학습 가능한 채널별 어텐션을 가능하게 한다.
- ReLU 활성화 함수를 적용하고, 가중치는 근처 0에 가까운 값으로 초기화하며, 편향은 1로 설정하여 학습 안정성을 확보한다.
- 체계적인 아블레이션을 통해 학습률, gMLP 및 트랜스포머 스택의 히든 차원 크기, 깊이 등의 하이퍼파라미터를 최적화한다.
- 최종 예측을 위해 정규화된 연속형 특징과 컬럼 임bed된 범주형 특징을 연결하여 gMLP 헤드에 입력한다.
실험 결과
연구 질문
- RQ1TabTransformer의 표준 MLP 헤드를 게이팅된 MLP(gMLP)로 교체할 경우, 표형 데이터의 이진 분류 작업에서 성능 향상이 이루어지는가?
- RQ2다양한 활성화 함수(ReLU, GELU, SELU, LeakyReLU)가 최종 분류 헤드 성능에 미치는 영향은 어떠한가?
- RQ3AUROC 성능과 모델 확장성 측면에서 gMLP 블록의 최적 히든 차원 크기는 무엇인가?
- RQ4학습률 스케줄링 전략이 GatedTabTransformer 아키텍처의 수렴과 최종 AUROC에 어떤 영향을 미치는가?
- RQ5선형 투영과 공간 게이팅 등의 아키텍처 수정 사항이 원래 TabTransformer 대비 일반화 능력 향상에 얼마나 기여하는가?
주요 결과
- GatedTabTransformer는 bank_marketing 데이터셋에서 원래 TabTransformer 대비 평균 AUROC 1.0% 향상 달성.
- 1995_income 데이터셋에서는 TabTransformer 대비 0.7% AUROC 향상, 기준 MLP 모델 대비 2.5% 향상.
- blastchar 데이터셋은 TabTransformer 대비 0.5% AUROC 향상, MLP 대비 1.6% 향상되어 다양한 표형 데이터에서 일관된 성능 향상을 입증.
- 깊은 아키텍처에서 gMLP 블록은 표준 MLP보다 뛰어난 성능을 보이며, 히든 차원 크기가 증가함에 따라 성능이 지속적으로 향상되나, 표준 MLP는 포화 상태에 도달함.
- 음수 기울기 값이 0.01에서 0.05 사이인 LeakyReLU와 표준 ReLU가 가장 높은 성능을 보였으며, 단순성과 일관성 고려로 ReLU를 선택.
- 하이퍼파라미터 튜닝 결과, 히든 차원 크기를 32를 초과해 늘일수록 gMLP 성능이 지속적으로 향상되었으며, 반면 표준 MLP는 수익 감소 현상 발생.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.