Skip to main content
QUICK REVIEW

[论文解读] Understanding the Effectiveness of Very Large Language Models on Dialog Evaluation

Jessica Huynh, Cathy Jiao|arXiv (Cornell University)|Jan 27, 2023
Topic Modeling被引用 6
一句话总结

本文研究了大型语言模型(LLMs)在少样本和零样本对话评估中的有效性,表明经过指令微调和对话特定微调的 LLM 优于通用模型。主要发现显示,示例选择策略和模型预训练数据的多样性对性能有显著影响,InstructGPT 在多个对话评估指标上表现最佳。

ABSTRACT

Language models have steadily increased in size over the past few years. They achieve a high level of performance on various natural language processing (NLP) tasks such as question answering and summarization. Large language models (LLMs) have been used for generation and can now output human-like text. Due to this, there are other downstream tasks in the realm of dialog that can now harness the LLMs' language understanding capabilities. Dialog evaluation is one task that this paper will explore. It concentrates on prompting with LLMs: BLOOM, OPT, GPT-3, Flan-T5, InstructDial and TNLGv2. The paper shows that the choice of datasets used for training a model contributes to how well it performs on a task as well as on how the prompt should be structured. Specifically, the more diverse and relevant the group of datasets that a model is trained on, the better dialog evaluation performs. This paper also investigates how the number of examples in the prompt and the type of example selection used affect the model's performance.

研究动机与目标

  • 评估超大规模语言模型(LLMs)在少样本和零样本设置下进行细粒度对话评估的性能。
  • 研究模型架构、大小以及预训练数据对 LLM 在对话评估任务中性能的影响。
  • 分析上下文示例选择策略(例如,随机选择、BM25、基于相似性的方法)对评估准确率的影响。
  • 评估 LLM 在多样化对话数据集和指标(如流畅性、连贯性、一致性与相关性)上的泛化能力。
  • 识别出在稳健自动对话评估中表现最优的提示工程策略与模型特征。

提出的方法

  • 在多个对话评估基准上评估了六种 LLM:BLOOM、OPT、GPT-3、Flan-T5、InstructDial 和 TNLGv2。
  • 采用零样本和少样本提示方法,使用 4 个上下文示例,分别采用仅上下文或上下文与响应结合的示例。
  • 采用示例选择策略,包括随机采样、BM25 检索以及基于上下文或响应的相似性选择。
  • 使用人工标注的数据集进行回合级(相关性、流畅性)和对话级(一致性、连贯性)评估指标的计算。
  • 通过与人类判断的相关性(如皮尔逊相关系数、F1 分数)比较不同数据集上的模型性能。
  • 分析模型大小和预训练数据多样性对零样本和少样本跨领域泛化能力的影响。
Figure 1: Large Language Models, comparison of select approximate sizes
Figure 1: Large Language Models, comparison of select approximate sizes

实验结果

研究问题

  • RQ1不同 LLM 架构和大小在多样化数据集上的零样本和少样本对话评估中表现如何?
  • RQ2上下文示例选择策略(随机、BM25、基于相似性)对 LLM 在对话评估中的性能有何影响?
  • RQ3预训练数据的多样性和相关性如何影响 LLM 在对话评估任务中的泛化能力?
  • RQ4哪种提示策略(例如,仅上下文 vs. 上下文与响应示例结合)能与人类判断达到最高的相关性?
  • RQ5指令微调或对话特定微调的模型在对话评估中在多大程度上优于通用 LLM?

主要发现

  • InstructGPT(text-davinci-002)在所有数据集和指标上均取得最高性能,优于通用模型和较小参数模型。
  • Flan-T5 和 InstructDial 展现出强大的零样本性能,在 6 个和 5 个共 8 个数据集上优于基线模型,表明指令微调的有效性。
  • 基于上下文和响应的示例选择在 EG 数据集上提升了性能,而对 530B 的 TNLGv2 模型而言,随机选择在 DGR 和 EG 数据集上优于算法化选择策略。
  • 在多样化、对话相关语料上训练的模型(如 TNLGv2、InstructDial)在跨领域泛化方面优于仅在广泛互联网数据上训练的模型。
  • 530B 的 TNLGv2 模型表现出色,尤其在少样本设置下,表明更大的模型规模有助于提升评估能力。
  • 较小的指令微调模型(如 Flan-T5 和 InstructDial)通常优于更大的非微调模型(如 BLOOM、OPT),凸显了任务特定微调的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。