Skip to main content
QUICK REVIEW

[論文レビュー] XTab: Cross-table Pretraining for Tabular Transformers

Bingzhao Zhu, Xingjian Shi|arXiv (Cornell University)|May 10, 2023
Data-Driven Disease Surveillance被引用数 6
ひとこと要約

XTabは、異なるカラムタイプや数を有する多様なデータセット間での知識移譲を可能にする、表形式変換器向けのクロステーブル事前学習フレームワークを提案する。フェデレーテッドラーニングを用いて、データ固有の特徴抽出モジュールと共有された変換器ブロックを同時に事前学習することで、汎化性能、学習速度、性能が著しく向上し、OpenML-AutoMLベンチマークの84の表形式タスクにおいて最先端のモデルを上回る結果を得た。

ABSTRACT

The success of self-supervised learning in computer vision and natural language processing has motivated pretraining methods on tabular data. However, most existing tabular self-supervised learning models fail to leverage information across multiple data tables and cannot generalize to new tables. In this work, we introduce XTab, a framework for cross-table pretraining of tabular transformers on datasets from various domains. We address the challenge of inconsistent column types and quantities among tables by utilizing independent featurizers and using federated learning to pretrain the shared component. Tested on 84 tabular prediction tasks from the OpenML-AutoML Benchmark (AMLB), we show that (1) XTab consistently boosts the generalizability, learning speed, and performance of multiple tabular transformers, (2) by pretraining FT-Transformer via XTab, we achieve superior performance than other state-of-the-art tabular deep learning models on various tasks such as regression, binary, and multiclass classification.

研究の動機と目的

  • 新しいテーブルにおいてカラムタイプや数が異なる状況でも、表形式ディープラーニングモデルの汎化性能が低いという問題に対処すること。
  • 異なるドメインからの複数のテーブル間で知識移譲を可能にし、ドメイン特化型事前学習の限界を克服すること。
  • スケーラブルで分散型の事前学習フレームワークを構築し、表形式変換器の転移学習を可能にすること。
  • クロステーブル事前学習が、未観測のテーブルにおいて学習速度、モデル性能、汎化性能を向上させることを実証すること。
  • 単一ドメインや単一テーブルの微調整にとどまらない、表形式モデルの事前学習の新しいベンチマークを確立すること。

提案手法

  • 変動するカラムタイプや数に対応するため、表形式変換器をデータ固有の特徴抽出モジュールと共有されたクロステーブルコンポonentに分解する。
  • 多様なドメインにまたがる多数のテーブルからなる大規模なコレクションを用いて、フェデレーテッドラーニングにより共有コンポonentを同時に事前学習する。
  • 自己教師付きの事前学習タスク(例:マスキングカラム予測、対照的学習)を用いて、汎用的な表形式表現を学習する。
  • 未観測のテーブルにおける学習を早期に開始できるように、事前学習済みの共有重みで新しいモデルを初期化する。
  • 各テーブルカラムをトークンとして扱う統一アーキテクチャを採用し、可変長テーブルにおけるアテンションベースのモデリングを可能にする。
  • OpenML-AutoMLベンチマークの84のデータセットを用いて事前学習することで、広範なドメインカバレッジと汎化性能を確保する。

実験結果

リサーチクエスチョン

  • RQ1異なるカラムタイプや構造を持つデータセット間で、クロステーブル事前学習が表形式変換器の汎化性能を向上させることができるか?
  • RQ2多様で不均一な多数のテーブルを用いた事前学習が、下流タスクにおける収束速度と性能を向上させるか?
  • RQ3フェデレーテッドラーニングが、複数のテーブルにまたがる事前学習を効果的にスケーリングしつつ、モデルの汎化性能を維持できるか?
  • RQ4XTabは、ランダム初期化やドメイン特化型事前学習と比較して、性能とサンプル効率の面で優れているか?
  • RQ5FT-Transformerなどの最先端の表形式モデルの性能は、XTabによってどの程度向上するか?

主な発見

  • XTabは、OpenML-AutoMLベンチマークの84のタスクにおいて、複数の表形式変換器の性能、学習速度、汎化性能を一貫して向上させた。
  • XTabで事前学習済み重みを用いて微調整したFT-Transformerは、回帰、二値分類、多値分類タスクにおいて、他のすべての最先端の表形式ディープラーニングモデルを上回った。
  • mfeat-factorsデータセットでは、ログロスをランダム初期化時の0.1636から0.1089に低下させ、相対的に33.3%の改善を達成した。
  • boston回帰タスクでは、RMSEを3.3039から2.8631に低下させ、13.3%の相対的改善を達成した。
  • wine-quality-white多値分類タスクでは、ログロスを0.803から0.7847に低下させ、2.3%の相対的改善を達成した。
  • XTabは、84のタスクのうち18のタスクで最良のベースラインを上回り、すべてのタスクタイプで一貫した向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。