[论文解读] RPT: Relational Pre-trained Transformer Is Almost All You Need towards Democratizing Data Preparation
RPT,一种关系型预训练变换器,利用带有双向编码器和自回归解码器的去噪自编码器进行预训练,以在原始关系元组上进行训练,从而实现数据准备任务(如数据清洗、模式匹配、实体解析和信息抽取)的零样本和少样本学习。即使在少样本设置中无任何标注样本的情况下,其性能仍可与使用1,000多个标注样本微调的模型相媲美,达到最先进水平。
Can AI help automate human-easy but computer-hard data preparation tasks that burden data scientists, practitioners, and crowd workers? We answer this question by presenting RPT, a denoising auto-encoder for tuple-to-X models (X could be tuple, token, label, JSON, and so on). RPT is pre-trained for a tuple-to-tuple model by corrupting the input tuple and then learning a model to reconstruct the original tuple. It adopts a Transformer-based neural translation architecture that consists of a bidirectional encoder (similar to BERT) and a left-to-right autoregressive decoder (similar to GPT), leading to a generalization of both BERT and GPT. The pre-trained RPT can already support several common data preparation tasks such as data cleaning, auto-completion and schema matching. Better still, RPT can be fine-tuned on a wide range of data preparation tasks, such as value normalization, data transformation, data annotation, etc. To complement RPT, we also discuss several appealing techniques such as collaborative training and few-shot learning for entity resolution, and few-shot learning and NLP question-answering for information extraction. In addition, we identify a series of research opportunities to advance the field of data preparation.
研究动机与目标
- 为解决数据准备任务(如数据清洗、模式匹配、实体解析和信息抽取)的劳动密集型和耗时问题。
- 开发一种用于关系型数据的自监督预训练框架,通过接触大规模表格语料库,模拟人类知识获取过程。
- 实现迁移学习和少样本微调,使模型能够仅用极少的标注样本快速适应新的数据准备任务。
- 通过减少对专家标注数据的依赖,使非专家也能借助人工智能完成复杂的数据任务,从而实现数据准备的民主化。
- 识别并探索将关系型数据任务与预训练NLP模型及AI-众包协作相结合的新研究机遇。
提出的方法
- RPT采用去噪自编码器作为预训练目标,其中输入元组被破坏,模型学习重建原始元组。
- 采用基于Transformer的架构,包含双向编码器(类似BERT)和从左到右的自回归解码器(类似GPT),实现上下文表征与序列生成的联合学习。
- 模型在无任何人工标注标签的大规模关系型表格语料库上进行预训练,学习跨多样化数据模式和值的通用模式。
- 在下游任务中,RPT通过标准的监督微调进行微调,以适应诸如值归一化、数据转换和标注等任务。
- 引入协作训练(CT),通过利用模型置信度和多个预测之间的一致性,在无需标注样本的情况下训练实体匹配器。
- 在信息抽取任务中,通过从少量样本生成问题模板(例如,'什么是[M]?'),并将RPT与NLP问答模型结合,利用预训练的问答模型提取词段。
实验结果
研究问题
- RQ1自监督预训练模型能否从原始表格中学习到可泛化的关联型模式,从而在无需人工标注标签的情况下支持多样化数据准备任务?
- RQ2预训练的RPT模型在数据清洗、模式匹配和实体解析任务中,其零样本或少样本学习能力在多大程度上有效?
- RQ3在不依赖任何标注训练样本的情况下,实体匹配器的协作训练能否达到与监督模型相当的性能?
- RQ4如何通过预训练模型和提示工程,有效将信息抽取任务映射到NLP问答基准?
- RQ5RPT及其变体能否通过用AI工作者替代或增强众包工作者,显著减少众包中的人工劳动?
主要发现
- 协作训练(CT)在Abt-Buy数据集上达到F1值0.72,在Amazon-Google数据集上达到0.53,优于ZeroER,并与需要7,689和9,167个标注样本的DeepMatcher性能相当。
- 在Abt-Buy数据集上,CT性能与Ditto(F1: 0.71)相当,且未使用测试集中的任何标注样本,证明了其强大的少样本泛化能力。
- 在1,000多个标注样本上微调的RPT在实体解析任务上达到最先进性能,表现与DeepMatcher和Ditto相当或更优。
- 通过提示模板将RPT与NLP问答结合,实现了有效的信息抽取,性能与现有最先进方法相当。
- 该模型在多个数据准备任务中实现了零样本和少样本能力,显著减少了对人工标注数据的需求。
- 结果验证了使用预训练关系型模型实现数据准备民主化的可行性,降低了对专家劳动和标注数据集的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。