Skip to main content
QUICK REVIEW

[论文解读] MET: Masked Encoding for Tabular Data

Kushal Majmundar, Sachin Goyal|arXiv (Cornell University)|Jun 17, 2022
Domain Adaptation and Few-Shot Learning被引用 4
一句话总结

MET 提出了一种新颖的、基于重建的自监督学习方法,用于表格数据,通过使用坐标特定的表示和对抗性重建损失,消除了数据增强的需要。该方法实现了最先进性能,在五个不同的表格数据集上,将下游分类准确率提升了高达9%。

ABSTRACT

We consider the task of self-supervised representation learning (SSL) for tabular data: tabular-SSL. Typical contrastive learning based SSL methods require instance-wise data augmentations which are difficult to design for unstructured tabular data. Existing tabular-SSL methods design such augmentations in a relatively ad-hoc fashion and can fail to capture the underlying data manifold. Instead of augmentations based approaches for tabular-SSL, we propose a new reconstruction based method, called Masked Encoding for Tabular Data (MET), that does not require augmentations. MET is based on the popular MAE approach for vision-SSL [He et al., 2021] and uses two key ideas: (i) since each coordinate in a tabular dataset has a distinct meaning, we need to use separate representations for all coordinates, and (ii) using an adversarial reconstruction loss in addition to the standard one. Empirical results on five diverse tabular datasets show that MET achieves a new state of the art (SOTA) on all of these datasets and improves up to 9% over current SOTA methods. We shed more light on the working of MET via experiments on carefully designed simple datasets.

研究动机与目标

  • 为自监督学习中针对非结构化表格数据设计有效数据增强方法的挑战提供解决方案。
  • 开发一种基于重建的对比学习替代方法,用于表格自监督学习,避免依赖于临时或领域特定的增强方法。
  • 通过利用坐标特定嵌入和对抗性训练,改进表格数据的表征学习。
  • 证明在表格自监督学习中,将所有标记表示拼接而非池化,可带来更好的下游性能。
  • 探究基于重建的方法是否能在非线性数据分布中学习到线性可分的表征。

提出的方法

  • MET 使用基于 Transformer 的编码器-解码器架构,对表格数据中的掩码特征进行重建。
  • 对部分特征应用掩码,并对所有掩码坐标使用可学习的掩码标记,同时为每个特征添加位置编码。
  • 与平均池化不同,MET 在微调阶段将所有特征的表示进行拼接,以保留坐标特定的信息。
  • 通过在输入空间执行梯度上升来生成扰动,引入对抗性重建损失,以提升模型鲁棒性。
  • 模型通过标准掩码重建损失与对抗性重建损失的组合进行端到端训练。
  • 该方法避免了实例级别的数据增强,完全依赖于重建和对抗性正则化。

实验结果

研究问题

  • RQ1基于重建的方法是否能在表格自监督表征学习中超越对比学习方法?
  • RQ2在表格自监督学习中,将所有标记表示拼接而非池化,是否能带来更好的下游性能?
  • RQ3通过在重建损失上执行梯度上升进行对抗性训练,是否能提升表格数据中的模型泛化能力?
  • RQ4为何基于重建的方法即使在非线性数据分布中也能学习到线性可分的表征?
  • RQ5MET 在多样化的表格基准测试中,与现有最先进方法(如 DACL、SubTab 和 VIME)相比表现如何?

主要发现

  • MET 在五个标准表格数据集上实现了新的最先进性能,平均准确率相比之前最先进方法提升了 3.2%。
  • 在 FMNIST 和 CovType 数据集上,MET 分别实现了 90.94% 和 74.12% 的下游准确率,优于基线方法。
  • 在仅使用 20% 标注数据训练时,MET 在某些数据集上可达到使用完整标注集的监督学习性能。
  • 为每个特征使用独立的掩码标记可提升异质数据集(如 CovType)上的性能(75.40% vs 74.12% 的共享标记),尽管内存开销更高。
  • 将掩码标记通过编码器传递会降低性能并增加计算量,证实直接输入解码器更为可取。
  • 在简单合成数据集上的实验表明,MET 学习到的表征可使原本非线性可分的数据变得线性可分,表明其具有更好的解耦与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。