[论文解读] Data-Efficient Pretraining via Contrastive Self-Supervision
本文提出 CLESS,一种数据与计算高效的大规模对比自监督方法,用于 NLP 预训练。该方法仅使用 60MB 的任务内部文本,在零样本、少样本和长尾泛化任务中均优于 RoBERTa(后者在 160GB 外部数据上预训练),且训练时间仅为 1/5。该方法实现了无需大规模预训练数据或模型参数量的高效自监督学习,表明增加自监督信号可替代数据与参数量扩展,从而实现更高效、更公平的低资源表示学习。
For natural language processing `text-to-text' tasks, the prevailing approaches heavily rely on pretraining large self-supervised models on increasingly larger `task-external' data. Transfer learning from high-resource pretraining works well, but research has focused on settings with very large data and compute requirements, while the potential of efficient low-resource learning, without large `task-external' pretraining, remains under-explored. In this work, we evaluate against three core challenges for resource efficient learning. Namely, we analyze: (1) pretraining data ($X$) efficiency; (2) zero to few-shot label ($Y$) efficiency; and (3) long-tail generalization, since long-tail preservation has been linked to algorithmic fairness and because data in the tail is limited by definition. To address these challenges, we propose a data and compute efficient self-supervised, contrastive text encoder, pretrained on 60MB of `task-internal' text data, and compare it to RoBERTa, which was pretrained on 160GB of `task-external' text. We find our method outperforms RoBERTa, while pretraining and fine-tuning in a 1/5th of RoBERTa's fine-tuning time.
研究动机与目标
- 探究在极小数据和计算资源下,自监督预训练是否仍具有效性,挑战当前对大规模‘任务外部’预训练的依赖。
- 评估低资源设置下的数据效率(X-效率)、标签效率(Y-效率)以及长尾泛化性能。
- 通过保留罕见类别信息,解决算法公平性问题,而该问题在大规模预训练中常被忽视。
- 证明对比自监督可替代大规模预训练数据与模型规模,以实现更高效、更公平的表示学习。
- 开发一种无需依赖监督预训练的自监督、零样本可迁移模型,可直接应用于下游任务。
提出的方法
- 提出 CLESS,一种对比自监督目标(对比学习-数据高效自监督),从 60MB 的任务内部文本中学习,避免使用外部预训练数据。
- 在嵌入空间中采用基于噪声对比估计的对比目标,支持无限类别集合,并相比基于 Softmax 的目标降低计算成本。
- 在自监督伪标签上对小型模型(最多 1000 万个参数)进行预训练,这些伪标签由同一任务数据生成,从而在不依赖外部数据的前提下提升信号多样性。
- 通过直接将自监督表示头迁移到下游任务,实现零样本预测,避免微调引入的偏差。
- 将类别频率划分为五个区间(从头部到尾部),以公平评估长尾泛化性能,其中尾部区间包含 1,315 个类别中的 80.7%。
- 在零样本、少样本和长尾泛化基准上,将 CLESS 与 RoBERTa(1.25 亿参数,160GB 预训练数据)进行对比。
实验结果
研究问题
- RQ1仅使用 60MB 的任务内部数据,自监督模型能否实现强性能,甚至超越在 160GB 外部数据上预训练的模型?
- RQ2与标准掩码语言建模相比,对比自监督是否能实现更好的零样本和少样本泛化,尤其是在标注数据有限的情况下?
- RQ3一个小型对比预训练模型是否能比 RoBERTa(大型外部预训练模型)更好地泛化到长尾类别?
- RQ4即使预训练数据极少,增加自监督信号和模型规模是否仍能提升长尾泛化性能?
- RQ5对比自监督能否替代大规模预训练数据与模型规模,以实现高效且公平的表示学习?
主要发现
- CLESS 在零样本学习中优于 RoBERTa,在模型参数量增加 25% 的情况下,性能提升达 49%。
- 在少样本学习中,CLESS 在仅使用 60MB 任务内部数据预训练的情况下,性能优于在 160GB 外部数据上微调的 RoBERTa,即使仅使用 10% 的标注样本。
- 最大规模的 CLESS 模型(1000 万个参数)在长尾类别区间中平均微 F1 达 .251,而 RoBERTa 为 .173,其在 99.5% 的类别上表现更优。
- 尽管预训练数据量少三个数量级且参数更少,CLESS 显著优于 RoBERTa 保留长尾信息,这与‘更大数据总能提升罕见类别学习’的假设相矛盾。
- 增加自监督伪标签数量和模型规模可提升长尾泛化性能,表明自监督中的信号数量与模型规模可补偿数据规模的不足。
- CLESS 的预训练与微调耗时仅 15+10 小时,而 RoBERTa 仅微调阶段即耗时 126 小时,训练成本降低 5 倍。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。