Skip to main content
QUICK REVIEW

[论文解读] CIFT: Crowd-Informed Fine-Tuning to Improve Machine Learning Ability

John P. Lalor, Hao Wu|arXiv (Cornell University)|Feb 27, 2017
Mobile Crowdsensing and Crowdsourcing参考文献 45被引用 9
一句话总结

CIFT 提出了一种新颖的微调框架,利用项目反应理论(IRT)从众包响应中生成专门的、基于群体意见的训练集,从而提升深度神经网络在自然语言处理(NLP)任务上的性能。通过使用两种不同的损失函数——记忆化损失和分布匹配损失——对 IRT 衍生的数据进行微调,CIFT 显著提升了最先进的文本蕴涵识别(RTE)模型在大规模基准测试中的表现。

ABSTRACT

Item Response Theory (IRT) allows for measuring ability of Machine Learning models as compared to a human population. However, it is difficult to create a large dataset to train the ability of deep neural network models (DNNs). We propose Crowd-Informed Fine-Tuning (CIFT) as a new training process, where a pre-trained model is fine-tuned with a specialized supplemental training set obtained via IRT model-fitting on a large set of crowdsourced response patterns. With CIFT we can leverage the specialized set of data obtained through IRT to inform parameter tuning in DNNs. We experiment with two loss functions in CIFT to represent (i) memorization of fine-tuning items and (ii) learning a probability distribution over potential labels that is similar to the crowdsourced distribution over labels to simulate crowd knowledge. Our results show that CIFT improves ability for a state-of-the art DNN model for Recognizing Textual Entailment (RTE) tasks and is generalizable to a large-scale RTE test set.

研究动机与目标

  • 解决在自然语言处理(NLP)任务中微调深度神经网络(DNN)时,高质量、有限的训练数据不足的挑战。
  • 利用众包响应模式建模类人推理与知识,以提升 DNN 的泛化能力。
  • 开发一种微调方法,同时结合对特定项目的记忆化学习与对集体人类标签分布的对齐。
  • 通过 IRT 指导的训练数据,提升最先进的 DNN 模型在文本蕴涵识别(RTE)任务中的表现。
  • 证明所提出的 CIFT 框架在大规模 RTE 测试集上的可扩展性。

提出的方法

  • 将项目反应理论(IRT)应用于大规模众包响应数据,拟合模型以提取项目难度和区分度参数。
  • 利用拟合后的 IRT 模型生成一个专门的补充训练集,其中包含经过校准难度和标签分布的项目。
  • 使用 IRT 衍生的数据集对预训练 DNN 进行微调,采用两种不同的损失函数:一种用于记忆正确答案,另一种用于匹配群体的标签分布。
  • 将 IRT 衍生的数据整合到微调过程中,以引导参数更新,使其反映人类推理模式。
  • 在原始数据与 IRT 指导的数据组合上训练 DNN,以提升在 RTE 任务中模型的泛化能力与鲁棒性。
  • 在大规模 RTE 测试集上评估微调后的模型,以衡量性能提升与泛化能力。

实验结果

研究问题

  • RQ1基于 IRT 衍生的、众包信息驱动的数据能否提升 DNN 在文本蕴涵识别(RTE)任务中的表现?
  • RQ2与标准微调相比,使用 IRT 生成的数据进行微调在模型能力与泛化能力方面表现如何?
  • RQ3在微调过程中建模群体标签分布是否能提升 DNN 与类人推理的一致性?
  • RQ4CIFT 框架能否有效应用于大规模 RTE 基准测试,而不仅限于小规模验证?
  • RQ5在 CIFT 训练目标中,记忆化与分布匹配的相对贡献分别是什么?

主要发现

  • CIFT 显著提升了最先进的 DNN 模型在文本蕴涵识别(RTE)任务中的表现。
  • 在微调过程中使用 IRT 指导的数据,相比标准微调,能带来可测量的模型性能提升。
  • CIFT 中的双损失策略——平衡记忆化与分布匹配——在提升模型泛化能力方面被证明是有效的。
  • CIFT 框架在大规模 RTE 测试集上表现出良好的泛化能力,表明其具备鲁棒性与可扩展性。
  • IRT 衍生的训练集捕捉到了有意义的人类类标签分布,使模型能够从集体人类知识中学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。