Skip to main content
QUICK REVIEW

[論文レビュー] The GatedTabTransformer. An enhanced deep learning architecture for tabular modeling

Radostin Cholakov, Todor Kolev|arXiv (Cornell University)|Jan 1, 2022
Machine Learning and Data Classification被引用数 14
ひとこと要約

この論文では、TabTransformer の標準的なMLPヘッドをゲーテッドMLP(gMLP)ブロックに置き換えることで性能を向上させた、表形式データ向けの強化された深層学習アーキテクチャ、GatedTabTransformerを提案する。線形投影と空間ゲーティングユニットを組み込むことで、3つのバイナリ分類データセットで元のTabTransformerに比べ0.5%〜1.1%のAUROC向上を達成し、ベースラインモデルに比べ最大3.1%の向上を示した。

ABSTRACT

There is an increasing interest in the application of deep learning architectures to tabular data. One of the state-of-the-art solutions is TabTransformer which incorporates an attention mechanism to better track relationships between categorical features and then makes use of a standard MLP to output its final logits. In this paper we propose multiple modifications to the original TabTransformer performing better on binary classification tasks for three separate datasets with more than 1% AUROC gains. Inspired by gated MLP, linear projections are implemented in the MLP block and multiple activation functions are tested. We also evaluate the importance of specific hyper parameters during training.

研究の動機と目的

  • 表形式データのバイナリ分類タスクにおけるTabTransformerの性能を向上させること。
  • 標準的なMLPヘッドをゲーテッドMLP(gMLP)に置き換えることで、一般化性能および特徴表現が向上するかどうかを調査すること。
  • 収束性および性能の向上を図るため、学習率、隠れ次元、活性化関数などの主要ハイパーパrameterを最適化すること。
  • さまざまな表形式データセットにおけるモデルの頑健性およびスケーラビリティに及ぼすアーキテクチャ的変更の影響を評価すること。

提案手法

  • TabTransformerの最終段階の多層パーセプトロン(MLP)ヘッドを、トークン間相互作用に空間ゲーティングユニットを用いるゲーテッドMLP(gMLP)ブロックに置き換える。
  • gMLPブロック内でチャネル次元に沿って線形投影(UおよびV)を実装し、特徴変換を強化する。
  • 空間ゲーティングユニットを s(Z) = Z * f_{W,b}(Z) として定義し、f_{W,b}(Z) = WZ + b となるようにし、学習可能なチャネル別アテンションを可能にする。
  • ReLU活性化関数を適用し、重みをほぼゼロに初期化し、バイアスを1に初期化することで学習の安定化を図る。
  • 体系的なアブレーションを通じて、gMLPおよびTransformerスタックの学習率、隠れ次元サイズ、深さなどのハイパーパrameterを最適化する。
  • 最終予測のため、正規化された連続特徴とカラム埋め込み済みカテゴリカル特徴を連結してgMLPヘッドに供給する。

実験結果

リサーチクエスチョン

  • RQ1TabTransformerの標準的なMLPヘッドをゲーテッドMLP(gMLP)に置き換えることで、表形式データのバイナリ分類タスクにおける性能が向上するか?
  • RQ2ReLU、GELU、SELU、LeakyReLUといった異なる活性化関数は、最終分類ヘッドの性能にどのように影響するか?
  • RQ3AUROC性能とモデルのスケーラビリティの観点から、gMLPブロックの最適な隠れ次元サイズは何か?
  • RQ4学習率スケジューリングは、GatedTabTransformerアーキテクチャにおける収束性および最終AUROCにどのように影響するか?
  • RQ5線形投影や空間ゲーティングといったアーキテクチャ的変更は、元のTabTransformerに比べ一般化性能をどの程度向上させるか?

主な発見

  • GatedTabTransformerは、bank_marketingデータセットで元のTabTransformerに比べ平均1.0%のAUROC向上を達成した。
  • 1995_incomeデータセットでは、TabTransformerに比べ0.7%のAUROC向上、ベースラインMLPに比べ2.5%の向上を示した。
  • blastcharデータセットでは、TabTransformerに比べ0.5%のAUROC向上、MLPに比べ1.6%の向上を示し、多様な表形式データで一貫した向上が確認された。
  • gMLPブロックは、より深いアーキテクチャにおいて標準MLPを上回り、隠れ次元サイズが増加するにつれて性能が安定的に向上する一方、標準MLPは性能が頭打ちになるのに対し、gMLPは継続的な向上を示した。
  • 負の勾配が0.01〜0.05のLeakyReLUと標準ReLUが最も高い性能を示し、シンプルさと一貫性を考慮してReLUが採用された。
  • ハイパーパラメータチューニングの結果、隠れ次元サイズを32を超えて増加させることでgMLPの性能が一貫して向上したが、標準MLPでは収益逓減の傾向が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。