[论文解读] Wisdom of Instruction-Tuned Language Model Crowds. Exploring Model Label Variation
本文提出利用五种最先进指令微调语言模型之间的标签差异,作为一种集体标注形式,以提升零样本文本分类性能。通过使用贝叶斯加权聚合预测——类似于人类共识——模型集成在平均上比单个模型高出8.3 F1分,尽管性能仍落后于简单的监督模型。
Large Language Models (LLMs) exhibit remarkable text classification capabilities, excelling in zero- and few-shot learning (ZSL and FSL) scenarios. However, since they are trained on different datasets, performance varies widely across tasks between those models. Recent studies emphasize the importance of considering human label variation in data annotation. However, how this human label variation also applies to LLMs remains unexplored. Given this likely model specialization, we ask: Do aggregate LLM labels improve over individual models (as for human annotators)? We evaluate four recent instruction-tuned LLMs as annotators on five subjective tasks across four languages. We use ZSL and FSL setups and label aggregation from human annotation. Aggregations are indeed substantially better than any individual model, benefiting from specialization in diverse tasks or languages. Surprisingly, FSL does not surpass ZSL, as it depends on the quality of the selected examples. However, there seems to be no good information-theoretical strategy to select those. We find that no LLM method rivals even simple supervised models. We also discuss the tradeoffs in accuracy, cost, and moral/ethical considerations between LLM and human annotation.
研究动机与目标
- 评估在多样化文本分类任务中,利用多个大语言模型作为零样本标注者的效果。
- 探究大语言模型之间的标签差异——类似于人类标注者分歧——是否可被利用以提升预测可靠性。
- 在多种语言和任务中,比较聚合的大语言模型预测与单个模型及监督基线的性能。
- 分析基于大语言模型标注与人工标注在成本、速度、准确率和偏差之间的权衡。
- 考察在敏感或主观任务中,用大语言模型集成替代人工标注的伦理与实际影响。
提出的方法
- 将五种最先进指令微调的大语言模型(包括 GPT-3.5、PaLM 和 Flan-T5)在零样本设置下提示,以将文本分类到预定义标签中。
- 每个模型被视为独立标注者,对同一输入生成预测,且不访问真实标签。
- 应用标注的贝叶斯模型,基于推断的可靠性对单个模型预测进行加权,避免对真实标签的依赖。
- 聚合技术包括多数投票和贝叶斯分类器组合,后者用于提升鲁棒性和准确性。
- 在五个任务上评估性能——情感、主题、年龄、性别和仇恨言论预测——使用多语言数据集(英语、法语、德语、西班牙语)。
- 评估使用来自 Trustpilot 和 HatEval 的保留测试集,确保模型在训练分布外的数据上进行测试。
实验结果
研究问题
- RQ1通过聚合多个指令微调的大语言模型的预测,是否能将零样本文本分类性能提升至超过单个模型?
- RQ2模型性能在不同任务和语言中如何变化,是否存在任何单一大语言模型的持续优势?
- RQ3大语言模型之间的标签差异在多大程度上类似于人类标注者分歧,是否可被类似方式利用?
- RQ4聚合的大语言模型预测性能与简单监督模型及人工标注基线相比如何?
- RQ5在偏见和劳动力替代方面,用大语言模型集成替代人工标注的伦理与实际影响是什么?
主要发现
- 没有单一的大语言模型在所有任务、语言或标签类型上表现优异;性能差异显著,某些模型在特定任务上甚至低于随机基线。
- 使用贝叶斯加权聚合的预测在所有任务上平均优于单个模型 8.3 F1 分,证明了集成方法的价值。
- 即使最佳聚合的大语言模型性能仍显著低于简单监督模型,平均差距超过 10 F1 分。
- 在资源较少的语言如法语和德语上性能显著下降,表明当前跨语言泛化能力有限。
- 标签聚合可缓解部分个体模型的偏差,但无法消除底层模型中广泛存在或共享的偏差。
- 研究结论认为,尽管大语言模型聚合在成本和速度上优于人工标注,但人工标注在高性能和伦理负责的 NLP 应用中仍不可或缺。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。