Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting Pretraining Objectives for Tabular Deep Learning

Ivan Rubachev, Artem Alekberov|arXiv (Cornell University)|Jul 7, 2022
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

この論文は、表形式の深層学習モデルの事前学習目的を調査し、特にターゲットラベルを事前学習中に使用するターゲットに適応した事前学習が、下流タスクのパフォーマンスを顕著に向上させることを示している。自己予測と対照的学習の目的関数が競合可能であることが示され、シンプルなMLPですら、完全にラベルが付与されたデータセットにおいて、最先端のGBDTモデルに匹敵またはそれを上回る性能を発揮することが明らかになった。

ABSTRACT

Recent deep learning models for tabular data currently compete with the traditional ML models based on decision trees (GBDT). Unlike GBDT, deep models can additionally benefit from pretraining, which is a workhorse of DL for vision and NLP. For tabular problems, several pretraining methods were proposed, but it is not entirely clear if pretraining provides consistent noticeable improvements and what method should be used, since the methods are often not compared to each other or comparison is limited to the simplest MLP architectures. In this work, we aim to identify the best practices to pretrain tabular DL models that can be universally applied to different datasets and architectures. Among our findings, we show that using the object target labels during the pretraining stage is beneficial for the downstream performance and advocate several target-aware pretraining objectives. Overall, our experiments demonstrate that properly performed pretraining significantly increases the performance of tabular DL models, which often leads to their superiority over GBDTs.

研究の動機と目的

  • 多様なデータセットとアーキテクチャにおいて一貫してパフォーマンスを向上させる、表形式の深層学習のための効果的な事前学習目的を同定すること。
  • ラベル付きデータが豊富に存在する完全教師ありの表形式学習設定において、事前学習が測定可能な利点をもたらすかどうかを評価すること。
  • 自己予測、対照的学習、自己符号化、およびターゲットに適応したバリエーションを含む、さまざまな事前学習目的を、シンプルなアーキテクチャと高度なアーキテクチャの両方で比較すること。
  • アーキテクチャの選択やトレーニング手順を含む、表形式モデルの事前学習のベストプラクティスを確立すること。
  • 事前学習時のラベル情報の役割と、事前学習モデルのアンサンブルの影響を評価すること。

提案手法

  • 下流タスクのターゲットデータセットに対して直接事前学習を実施し、完全なラベル付きデータを用いることで、実際の産業界の環境を模倣する。
  • 自己予測(例:特徴量のマスキングと再構築)、対照的学習(データオーグメンテーションを介して)、自己符号化(再構築損失)を含む、複数の事前学習目的を提案・評価する。
  • ターゲットラベルを事前学習中に組み込むターゲットに適応した目的を導入し、たとえばターゲットに条件づけたマスキング特徴量の予測や、事前学習中にターゲットのサンプリングを実施する。
  • 標準的なMLPと、[14]からのような高度なエンベッディングベースのアーキテクチャを用いて、モデルタイプにわたる一般化性を評価する。
  • 標準的な評価プロトコルを採用:完全データセットで事前学習を行い、その後、標準的な訓練/検証/テスト分割を用いて微調整を実施する。
  • モデルの多様性とパフォーマンス向上の両面を評価するため、事前学習モデルのアンサンブルを適用する。

実験結果

リサーチクエスチョン

  • RQ1完全教師ありの設定において、表形式の深層学習モデルに対して事前学習が一貫したパフォーマンス向上をもたらすか?
  • RQ2自己予測、対照的学習、自己符号化といった異なる事前学習目的が、表形式データにおいてどのようにパフォーマンスを発揮するか?
  • RQ3事前学習中にターゲットラベルを組み込むことで、非教師あり目的よりも優れた下流タスクパフォーマンスが得られるか?
  • RQ4事前学習は、MLPのようなシンプルなアーキテクチャに特に利益をもたらすのか、それとも複雑なモデルに限られるのか?
  • RQ5事前学習モデルのアンサンブルは有効か?また、同じ初期化を共有しているにもかかわらず、モデルの多様性は保持されているか?

主な発見

  • 完全にラベルが付与された表形式データセットにおいて、事前学習は、よくチューニングされた教師ありベースラインを著しく上回り、しばしばGBDTモデルを上回るパフォーマンスを発揮する。
  • 自己予測に基づく目的(例:マスキングされた特徴量の予測)は、対照的学習と同等のパフォーマンスを達成しており、これは表形式の深層学習分野ではこれまで報告されていなかった発見である。
  • ターゲットに適応した事前学習目的(例:マスキング+ターゲット、再構築+ターゲット)は、非教師ありの対応する目的を一貫して上回り、事前学習中にラベル情報を活用することの価値を示している。
  • 事前学習によるパフォーマンス向上は、特にシンプルなMLPアーキテクチャにおいて顕著であり、事前学習により、元々のスクラッチ学習で最良のモデルに匹敵する性能が達成される。
  • 事前学習モデルのアンサンブルはさらなるパフォーマンス向上をもたらし、事前学習がモデルの多様性を過度に制限していないことを示している。
  • 最も優れた設定(マスキング+ターゲット)は、HIGGSデータセットでテストAUC 0.975 ± 2.8e-4を達成し、教師ありベースラインおよび他の事前学習バリエーションを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。