[論文レビュー] From Supervised to Generative: A Novel Paradigm for Tabular Deep Learning with Large Language Models
この論文は、115の多様な表形式データセット上で生成的表形式学習(GTL)を用いて大規模言語モデル(LLM)を微調整する、新しいパラダイムである表形式基盤モデル(TabFMs)を紹介する。これにより、指示従い、少サンプル微調整が可能になる。このアプローチは、ゼロショットおよび文脈学習においてGPT-4と同等またはそれを上回る性能を達成し、低ショット状況でも優れたデータ効率性を示す。
Tabular data is foundational to predictive modeling in various crucial industries, including healthcare, finance, retail, sustainability, etc. Despite the progress made in specialized models, there is an increasing demand for universal models that can transfer knowledge, generalize from limited data, and follow human instructions. These are challenges that current tabular deep learning approaches have not fully tackled. Here we introduce Generative Tabular Learning (GTL), a novel framework that integrates the advanced functionalities of large language models (LLMs)-such as prompt-based zero-shot generalization and in-context learning-into tabular deep learning. GTL capitalizes on the pre-training of LLMs on diverse tabular data, enhancing their understanding of domain-specific knowledge, numerical sequences, and statistical dependencies critical for accurate predictions. Our empirical study spans 384 public datasets, rigorously analyzing GTL's convergence and scaling behaviors and assessing the impact of varied data templates. The GTL-enhanced LLaMA-2 model demonstrates superior zero-shot and in-context learning capabilities across numerous classification and regression tasks. Notably, it achieves this without fine-tuning, outperforming traditional methods and rivaling state-of-the-art models like GPT-4 in certain cases. Through GTL, we not only foster a deeper integration of LLMs' sophisticated abilities into tabular data comprehension and application but also offer a new training resource and a test bed for LLMs to enhance their ability to comprehend tabular data. To facilitate reproducible research, we release our code, data, and model checkpoints at https://github.com/microsoft/Industrial-Foundation-Models.
研究の動機と目的
- 既存の転送可能な表形式モデルが、強力な指示従いや基盤的知識習得の能力に欠けているという限界を解消すること。
- 大規模言語モデルが、一般テキスト知識を超えて、多様な表形式データセットからのデータ駆動型知識を学習できることを可能にすること。
- 新しい表形式タスクにおけるゼロショット指示従いと少サンプル微調整の両方をサポートする統一フレームワークの開発。
- 多様な表形式データに対するドメインに依存しない事前学習を通じて、LLMの一般化能力とデータ効率性を向上させること。
- 表形式データを、構造化データ理解におけるLLM能力を強化する新しいコーパスとしての可能性を調査すること。
提案手法
- 115の公開表形式データセットを用いて、目的に特化した生成的表形式学習(GTL)目的関数で事前学習済みLLM(LLaMA-2)を微調整する。
- 自然言語記述から完全で整合性のある表形式データサンプルを生成できるように、系列から系列への学習目的関数を設計する。
- 医療、ファイナンス、小売、気候分野をカバーする多様な表形式データセットのコレクションを用い、広範な基盤的知識習得を保証する。
- LLMの文脈学習およびプロンプト工学の能力を活用して、指示従い(ゼロショット)および少サンプル微調整を両立させる。
- 構造化されたプロンプトテンプレートを用いて、LLMが表形式スキーマ、数値的パターン、統計的関係を理解できるように誘導する。
- 標準的な表形式ベンチマーク(AUROCおよび正答率メトリクスを含む)を用いて、9つのホールドアウトデータセットで性能を評価する。

実験結果
リサーチクエスチョン
- RQ1大規模言語モデルが、指示従いや少サンプル適応を両立させるために、多様な表形式データセットから基盤的知識を効果的に学習できるか。
- RQ2表形式データにおける生成的事前学習は、標準的な微調整と比較して、ゼロショットおよび文脈学習におけるLLMの性能をどのように向上させるか。
- RQ3表形式データで訓練された基盤モデルは、GPT-4のような閉鎖型モデルを、表形式推論タスクでどれほど模倣または凌駆できるか。
- RQ4データが不足する状況下でモデルはどのように動作するか。また、少サンプル状況においてデータ効率性を示すか。
- RQ5現在のLLMが表形式データを理解する際に抱える主な制限は何か。ドメイン特化の事前学習によってそれらの制限はどのように軽減できるか。
主な発見
- 提案されたTabFMsは、特にゼロショットおよび文脈学習設定において、ベースラインのLLaMA-2モデルやGPT-3.5を著しく上回る性能を示す。
- ホールドアウトされた9つの表形式データセットにおいて、TabFMsはGPT-4に近い性能を達成し、場合によってはそれを上回る。特に少サンプルおよびゼロショット状況で顕著である。
- 少サンプル微調整において、TabPFN や XGBoost といった最先端の表形式モデルと同等の性能を達成しており、高いデータ効率性を示している。
- Bank、Blood、C. Hous. データセットでは、ベースラインのLLaMAモデルが一般化に失敗する状況でも、TabFMsが顕著な性能向上を示している。
- 十分な訓練データが利用可能な場合、GTLによる性能向上は薄れる。これは、データが豊富な場合には統計的パターンが一般化を支配するためである。
- Jungleデータセット(AUROC 0.69 対 SOTA の 0.80)における失敗事例は、ゲームのようなニッチ分野の知識にLLMが限界を示している可能性を示唆しており、事前学習コーパスのバイアスや最適でないトークン化が原因である可能性がある。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。