Skip to main content
QUICK REVIEW

[论文解读] BigBIO: A Framework for Data-Centric Biomedical Natural Language Processing

Jason Fries, Leon Weber|arXiv (Cornell University)|Jun 30, 2022
Topic Modeling参考文献 138被引用 12
一句话总结

BigBIO 引入了一套由社区驱动的框架,为跨 12 项任务类别和 10 多种语言的 126 余个经过整理的生物医学 NLP 数据集提供程序化访问,支持零样本和少样本语言模型评估的可重现性元数据集构建。该框架基于 Hugging Face 的 datasets 库构建,并与 PromptSource 和 EleutherAI Harness 集成,简化了生物医学 NLP 中的提示工程与大规模多任务学习。

ABSTRACT

Training and evaluating language models increasingly requires the construction of meta-datasets --diverse collections of curated data with clear provenance. Natural language prompting has recently lead to improved zero-shot generalization by transforming existing, supervised datasets into a diversity of novel pretraining tasks, highlighting the benefits of meta-dataset curation. While successful in general-domain text, translating these data-centric approaches to biomedical language modeling remains challenging, as labeled biomedical datasets are significantly underrepresented in popular data hubs. To address this challenge, we introduce BigBIO a community library of 126+ biomedical NLP datasets, currently covering 12 task categories and 10+ languages. BigBIO facilitates reproducible meta-dataset curation via programmatic access to datasets and their metadata, and is compatible with current platforms for prompt engineering and end-to-end few/zero shot language model evaluation. We discuss our process for task schema harmonization, data auditing, contribution guidelines, and outline two illustrative use cases: zero-shot evaluation of biomedical prompts and large-scale, multi-task learning. BigBIO is an ongoing community effort and is available at https://github.com/bigscience-workshop/biomedical

研究动机与目标

  • 解决通用数据集枢纽(如 Hugging Face 的 datasets 库)中生物医学数据集代表性不足的问题。
  • 通过提供对经过整理的数据集的标准化、程序化访问,支持以数据为中心的生物医学语言模型开发。
  • 通过促进提示工程和跨数据集整合,支持语言模型的零样本和少样本评估。
  • 建立由社区驱动的数据集贡献、元数据统一化和数据审计指南。
  • 降低构建大规模元数据集用于多任务学习和基于提示的训练的工程成本。

提出的方法

  • BigBIO 从多样化来源聚合了 126 余个生物医学 NLP 数据集,每个数据集均带有关于来源、许可和任务类型的结构化元数据。
  • 它实现了轻量级、统一的数据模式,在保留原始数据集格式的同时,实现跨数据集的兼容性,以支持提示工程。
  • 该框架基于 Hugging Face 的 datasets 库构建,可与现有的 NLP 工具链和平台无缝集成。
  • 它与 PromptSource 集成,以实现系统的提示生成;并与 EleutherAI 语言模型评估框架集成,以实现标准化的零样本/少样本评估。
  • 建立了社区贡献管道,包括数据审计、模式统一化和版本控制,以确保可重现性。
  • 系统支持多语言和多任务评估,数据集被映射到 12 项任务类别,包括 NER、QA、TXTCLASS 和 RE。

实验结果

研究问题

  • RQ1如何系统化地整理生物医学 NLP 数据集并使其可程序化访问,以支持以数据为中心的语言建模?
  • RQ2BigBIO 在多大程度上可通过提示工程实现生物医学语言模型的零样本评估?
  • RQ3BigBIO 是否能够支持包含 100 多项不同生物医学 NLP 任务的大规模多任务学习?
  • RQ4模式统一化在保留数据集完整性的同时,实现跨数据集整合的有效性如何?
  • RQ5由社区驱动的整理与元数据标准化对生物医学 NLP 中的可重现性与模型评估有何影响?

主要发现

  • BigBIO 为 126 余个经过单元测试的生物医学 NLP 数据集提供程序化访问,涵盖 12 项任务类别和 10 余种语言,包含关于来源和许可的结构化元数据。
  • 该框架通过与 PromptSource 和 EleutherAI Harness 的集成,实现了生物医学语言模型的高效零样本评估。
  • BigBIO 支持超过 100 项多样化生物医学 NLP 任务的大规模多任务学习,显著降低了元数据集构建的工程开销。
  • 模式统一化在保留原始结构和任务语义的同时,实现了对数据集的一致性访问。
  • 社区驱动的贡献模式确保了数据质量、可重现性以及数据集库的长期可持续性。
  • 与现有 NLP 平台的集成,实现了在多样化生物医学任务中对提示和模型的端到端评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。