Skip to main content
QUICK REVIEW

[论文解读] SynthBio: A Case Study in Human-AI Collaborative Curation of Text Datasets

Ann Yuan, Daphne Ippolito|arXiv (Cornell University)|Nov 11, 2021
Topic Modeling参考文献 55被引用 8
一句话总结

本文提出 SynthBio,一种新颖的人机协作方法,通过利用大语言模型生成初始传记草稿,再由人工评估员进行编辑,从而构建高质量、低噪声的文本数据集。该数据集包含 4,692 个虚构人物传记,其性别与国籍分布更加均衡,对原始属性的忠实度更高,且流畅度低于真实世界数据,使其成为评估超越记忆化的 grounded 文本生成任务的稳健基准。

ABSTRACT

NLP researchers need more, higher-quality text datasets. Human-labeled datasets are expensive to collect, while datasets collected via automatic retrieval from the web such as WikiBio are noisy and can include undesired biases. Moreover, data sourced from the web is often included in datasets used to pretrain models, leading to inadvertent cross-contamination of training and test sets. In this work we introduce a novel method for efficient dataset curation: we use a large language model to provide seed generations to human raters, thereby changing dataset authoring from a writing task to an editing task. We use our method to curate SynthBio - a new evaluation set for WikiBio - composed of structured attribute lists describing fictional individuals, mapped to natural language biographies. We show that our dataset of fictional biographies is less noisy than WikiBio, and also more balanced with respect to gender and nationality.

研究动机与目标

  • 解决自然语言生成任务中高质量、低噪声文本数据集稀缺的问题。
  • 通过创建避免真实世界知识记忆化的合成基准,降低预训练模型带来的数据污染风险。
  • 通过刻意控制性别、国籍和知名程度类型等属性,提升评估数据集中的人口统计平衡性。
  • 开发一种可扩展、高效的构建流程,实现从人工撰写向人工编辑 LLM 生成种子的转变。
  • 评估在真实数据集上训练的模型是否能泛化到更丰富、更受控的分布上。

提出的方法

  • 利用大语言模型根据描述虚构人物的结构化信息框(infoboxes)生成传记初稿。
  • 由人工评估员对 LLM 生成的传记进行编辑与优化,将工作负担从完整创作降低至针对性修改。
  • 设计数据集时对性别、国籍、职业等属性进行控制,确保社会身份的均衡代表。
  • 实施严格的质量控制:评估员被指示在两分钟内无法修正的传记必须丢弃,边缘案例由作者复审。
  • 采用端到端的构建流程:首先选择知名程度类型,然后从模式中采样属性,最后使用 LLM 生成并优化文本。
  • 使用 GPT-2 语言模型困惑度与词汇多样性(Div-2)量化最终数据集的流畅度与词汇变化。

实验结果

研究问题

  • RQ1通过 LLM 生成种子的人机协作方式,能否显著降低高质量文本数据集构建的时间与成本?
  • RQ2具有受控人口统计属性的合成数据集,是否能产生比真实世界数据集更均衡、更少偏见的评估结果?
  • RQ3在真实数据集(如 WikiBio)上微调的模型,在合成的、更均衡的基准(如 SynthBio)上泛化的程度如何?
  • RQ4与真实数据集相比,合成数据集中生成传记对原始信息框的忠实度有何差异?
  • RQ5在合成数据中,尤其在非西方身份代表与代词一致性方面,会浮现哪些公平性问题?

主要发现

  • SynthBio 包含 2,249 个虚构信息框,对应 4,692 个传记,平均每个信息框生成 2.1 个传记,相比真实数据集显著降低了冗余度。
  • 最终数据集中的性别中性代词(they/them)占比达 16.2%,远高于原始 WikiBio 的 2%,表明包容性显著提升。
  • SynthBio 传记的 GPT-2 困惑度为 112.0(越低越流畅),而 WikiBio 为 97.7,表明其流畅度略低,但对源属性的忠实度更高。
  • 人工评估确认,SynthBio 传记对信息框的忠实度高于 WikiBio,同时保持了相近的流畅度。
  • 在 WikiBio 上微调的模型在 SynthBio 上表现显著更差,表明 SynthBio 捕捉到了更具挑战性、分布外的泛化基准。
  • 该数据集揭示了公平性问题,包括代词使用不一致(尤其对非二元性别个体)以及尽管设计初衷是平衡,仍存在西方机构与国籍的过度代表。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。