Skip to main content
QUICK REVIEW

[论文解读] SuperTML: Two-Dimensional Word Embedding for the Precognition on Structured Tabular Data

Baohua Sun, Lin Yang|arXiv (Cornell University)|Feb 26, 2019
Digital Media Forensic Detection参考文献 33被引用 9
一句话总结

SuperTML 提出了一种新颖的二维词嵌入方法,通过字符和数字字符嵌入将表格数据转换为类似图像的表示形式,无需进行数值预处理或缺失值处理,即可通过微调预训练的2D CNN(如ResNet和SE-Net)在表格分类任务中实现最先进性能。

ABSTRACT

Tabular data is the most commonly used form of data in industry. Gradient Boosting Trees, Support Vector Machine, Random Forest, and Logistic Regression are typically used for classification tasks on tabular data. DNN models using categorical embeddings are also applied in this task, but all attempts thus far have used one-dimensional embeddings. The recent work of Super Characters method using two-dimensional word embeddings achieved the state of art result in text classification tasks, showcasing the promise of this new approach. In this paper, we propose the SuperTML method, which borrows the idea of Super Characters method and two-dimensional embeddings to address the problem of classification on tabular data. For each input of tabular data, the features are first projected into two-dimensional embeddings like an image, and then this image is fed into fine-tuned two-dimensional CNN models for classification. Experimental results have shown that the proposed SuperTML method had achieved state-of-the-art results on both large and small datasets.

研究动机与目标

  • 解决将深度学习应用于结构化表格数据的挑战,传统上依赖于XGBoost等树模型。
  • 克服一维嵌入(如word2vec、fastText)在捕捉表格特征中结构和视觉模式方面的局限性。
  • 通过将特征转换为类似图像的表示形式,实现使用预训练2D CNN进行端到端表格数据分类。
  • 消除对人工预处理(如独热编码或数值插补)处理分类特征和缺失值的需求。
  • 探索二维嵌入(受Super Characters方法启发)在表格数据学习中的潜力,将特征值视为视觉形状。

提出的方法

  • 通过在特定空间位置(例如,类别特征放左上角,数值特征放右上角)将特征值作为文本或数字序列放置,将每个表格样本映射为2D图像。
  • 将类别特征直接以完整单词(如'blue')或缩写形式(如'b')作为像素值写入图像网格。
  • 将数值特征编码为数字字符串(如'55'、'17'),并将其放置在图像中指定区域,以保留其视觉形式。
  • 通过在2D图像中预定义位置书写' missing'一词来处理缺失值。
  • 在生成的图像表示上微调预训练的2D CNN模型(如ResNet、SE-Net、PolyNet)以实现端到端分类。
  • 使用图像命名约定(如'Sunny_0001.jpg')在训练过程中将图像文件映射到类别标签。

实验结果

研究问题

  • RQ1二维词嵌入能否有效表示表格数据用于分类,且性能优于传统的一维嵌入?
  • RQ2预训练的2D CNN通过类似图像的特征表示,能在多大程度上将图像分类知识迁移至表格数据分类?
  • RQ3SuperTML方法如何在无需显式预处理或嵌入层的情况下处理类别特征和缺失值?
  • RQ4数字形状的视觉相似性(如6.01与5.999)是否会对模型泛化能力产生负面影响,模型在这些模糊情况下表现如何?
  • RQ5SuperTML框架是否能在涵盖小型和大型表格数据集的多样化基准环境中实现最先进性能?

主要发现

  • SuperTML在大规模Kaggle竞赛和UCI表格数据集的前三大数据集上均实现了最先进性能,优于XGBoost等传统模型及一维嵌入方法。
  • 该方法无需进行数值转换、独热编码或缺失值插补,即可成功分类表格数据,将所有特征视为视觉文本模式。
  • 错误分析显示,模型的分类结果对小数数字的视觉形状敏感——例如,'6.0'与'5.999'在视觉上可能相似,导致误分类,尽管其数值接近。
  • 在Iris数据集中,一个具有数值(6.0, 2.2, 5.0, 1.5)的virginica样本被错误分类为versicolor,因其视觉表示更接近具有相似数字形状的训练versicolor样本。
  • 模型依赖视觉外观而非数值本身,使其能够学习数字形状中的隐含模式,但也带来了当数值接近但视觉形式不同时的挑战。
  • 该方法在使用领域特定CNN加速器的低功耗边缘设备上部署具有强大潜力,兼具高精度与低推理成本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。