Skip to main content
QUICK REVIEW

[论文解读] Can ChatGPT Detect Intent? Evaluating Large Language Models for Spoken Language Understanding

Mutian He, Philip N. Garner|arXiv (Cornell University)|May 22, 2023
Topic Modeling被引用 4
一句话总结

本文评估了大型语言模型,特别是 ChatGPT 和 GPT3.5,在零样本和上下文提示下用于语音理解(SLU)任务的表现,涵盖意图分类和槽位填充。研究发现,最大规模的模型在使用理想转录文本时,意图分类性能接近监督学习水平,但在槽位填充任务中表现显著不佳,且对自动语音识别(ASR)错误高度敏感,揭示了其在真实世界 SLU 部署中的局限性。

ABSTRACT

Recently, large pretrained language models have demonstrated strong language understanding capabilities. This is particularly reflected in their zero-shot and in-context learning abilities on downstream tasks through prompting. To assess their impact on spoken language understanding (SLU), we evaluate several such models like ChatGPT and OPT of different sizes on multiple benchmarks. We verify the emergent ability unique to the largest models as they can reach intent classification accuracy close to that of supervised models with zero or few shots on various languages given oracle transcripts. By contrast, the results for smaller models fitting a single GPU fall far behind. We note that the error cases often arise from the annotation scheme of the dataset; responses from ChatGPT are still reasonable. We show, however, that the model is worse at slot filling, and its performance is sensitive to ASR errors, suggesting serious challenges for the application of those textual models on SLU.

研究动机与目标

  • 评估类似 ChatGPT 的大型语言模型是否可在无需微调的情况下执行语音理解(SLU)任务。
  • 研究零样本和上下文提示在多种语言的意图分类和槽位填充任务中的有效性。
  • 评估这些模型在面对自动语音识别(ASR)错误时的鲁棒性。
  • 识别 LLM 在 SLU 中的失败模式和局限性,特别是由于标注方案复杂性和标签模糊性所致。
  • 探讨模型的实际理解能力是否超过其在意图和槽位标注等中间 SLU 任务上的表现。

提出的方法

  • 本研究使用零样本和 few-shot 提示,在 SLURP 和 MINDS-14 基准上评估 GPT3.5、ChatGPT、GPT2 和 OPT 模型。
  • 使用理想转录文本以隔离语言理解与 ASR 错误的影响,而使用 Whisper ASR 输出以评估对真实世界转录错误的鲁棒性。
  • 提示设计包含任务描述和上下文示例,以引导意图分类和槽位填充。
  • 对 100 个误分类样本进行错误分析,以评估误分类是源于模型理解偏差还是数据集标注问题。
  • 在固定提示和对话式设置下评估模型,以检验其请求澄清或动态适应的能力。
  • 比较不同模型规模下的性能表现,突出最大规模模型中出现的新兴能力。

实验结果

研究问题

  • RQ1大型语言模型如 ChatGPT 仅通过提示即可在 SLU 基准上实现高意图分类准确率,而无需任何微调吗?
  • RQ2模型规模如何影响零样本和上下文学习在意图分类和槽位填充任务上的表现?
  • RQ3当使用真实 ASR 转录文本时,ASR 错误在多大程度上会降低 LLM 在 SLU 任务中的性能?
  • RQ4为何槽位填充中的错误案例通常源于标注方案的复杂性,而非模型理解偏差?
  • RQ5模型的实际理解能力是否优于其在意图和槽位标注等中间 SLU 任务上的表现?

主要发现

  • 最大规模的模型,包括 ChatGPT 和 GPT3.5,在使用理想转录文本时,意图分类准确率接近监督模型水平,表明其具备新兴的零样本和上下文学习能力。
  • 较小的模型如 GPT2 和 OPT 表现显著更差,在零样本设置下接近随机水平,表明新兴能力特异性地存在于大规模模型中。
  • 在槽位填充任务中,性能远低于意图分类,错误率较高,原因在于数据集中存在重叠且反直觉的标签定义。
  • 当使用 ASR 转录文本而非理想转录文本时,模型性能显著下降,表明其对 ASR 错误高度敏感,且对发音或语音变体缺乏足够认知。
  • 许多‘错误’在意图分类中并非真正的理解偏差;在分析的 100 个错误案例中,79% 在上下文中是合理的,通常源于句子歧义或数据集标注不一致。
  • 模型倾向于过度拟合 few-shot 示例中的模式,例如基于有限示例将‘定义词’标记为特定类别,即使该做法不恰当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。