Skip to main content
QUICK REVIEW

[论文解读] jiant: A Software Toolkit for Research on General-Purpose Text Understanding Models

Yada Pruksachatkun, Phil Yeres|arXiv (Cornell University)|Mar 4, 2020
Topic Modeling参考文献 34被引用 20
一句话总结

jiant 是一个开源的、基于配置的工具包,用于在超过 50 项 NLU 任务(包括 GLUE 和 SuperGLUE 基准)上训练和评估通用文本理解模型。它支持 BERT 和 RoBERTa 等最先进模型的模块化、可复现实验,并以高精度复现了多个任务的已发表性能。

ABSTRACT

We introduce jiant, an open source toolkit for conducting multitask and transfer learning experiments on English NLU tasks. jiant enables modular and configuration-driven experimentation with state-of-the-art models and implements a broad set of tasks for probing, transfer learning, and multitask training experiments. jiant implements over 50 NLU tasks, including all GLUE and SuperGLUE benchmark tasks. We demonstrate that jiant reproduces published performance on a variety of tasks and models, including BERT and RoBERTa. jiant is available at https://jiant.info.

研究动机与目标

  • 为在多样化 NLU 任务上训练和评估通用文本理解模型提供一个统一、模块化且可复现的平台。
  • 通过配置而非代码修改,支持复杂训练流程,如多任务学习、迁移学习和多阶段训练(例如,中间任务微调)。
  • 使研究人员无需修改源代码即可轻松尝试最先进模型和基准任务。
  • 作为 SuperGLUE 基准的官方基线代码库,确保 NLU 研究中的一致性和可复现性。
  • 通过模块化架构和活跃的开源贡献模式,支持新任务、新模型和新训练配置的可扩展性。

提出的方法

  • jiant 使用基于配置的接口(HOCON 格式)定义实验,指定任务、句子编码器、输出头和训练超参数。
  • 它与 HuggingFace Transformers 和 AllenNLP 集成,以利用预训练模型和训练流程,抽象低级别实现细节。
  • 该工具包包含模块化组件架构:任务(数据、处理、指标)、句子编码器(如 BERT、ELMo、BiLSTM)、特定任务的输出头(如用于 NLI 或 POS),以及训练器(用于训练循环和模型保存)。
  • 通过配置定义的流水线支持多阶段训练,例如预训练 → 中间任务微调 → 目标任务微调,如 STILTs 中所用。
  • jiant 通过日志记录、模型检查点保存和任务间标准化数据处理,确保实验可复现。
  • 它支持单任务和多任务训练,内置对 GLUE、SuperGLUE、SentEval 和边缘探测等流行基准的支持。

实验结果

研究问题

  • RQ1jiant 是否能使用 BERT 和 RoBERTa 在 CommonsenseQA 和 SocialIQA 等标准 NLU 基准上复现已发表性能?
  • RQ2jiant 在支持复杂训练范式(如多阶段迁移学习,例如中间任务微调后接目标任务微调)方面效率如何?
  • RQ3jiant 的模块化架构在无需代码修改的情况下,多大程度上支持对新任务和新模型的便捷扩展?
  • RQ4与基于代码的训练流水线相比,jiant 的基于配置的设计在可复现性和易用性方面表现如何?
  • RQ5jiant 是否能作为大规模 NLU 基准测试(如 SuperGLUE 基准)的可靠、标准化基线?

主要发现

  • 在使用 RoBERTa-large 时,jiant 在 CommonsenseQA 上复现了已发表性能,准确率达到 72.2%,与报告的 72.1% 非常接近。
  • 在 SocialIQA 上使用 BERT-large 时,jiant 在验证集上达到 65.8% 的准确率,与报告的 66.0% 非常接近。
  • 在从 MNLI 到 BoolQ 的迁移学习中,jiant 将验证集准确率从 78.1% 提升至 80.3%,接近已发表结果中从 78.1% 提升至 82.2% 的改进幅度。
  • jiant 通过配置而非代码修改成功支持了多阶段训练流水线(如 STILTs 方法)。
  • 该工具包通过日志记录、检查点保存和所有 50 多项支持任务间标准化数据处理,保持了高度可复现性。
  • jiant 在多项研究工作中被用于探针实验、迁移学习和基准构建,证实了其在真实世界 NLP 研究中的实用性和稳健性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。