[论文解读] Can Large Language Models Aid in Annotating Speech Emotional Data? Uncovering New Frontiers
本文提出使用大型语言模型(LLMs),特别是ChatGPT,通过结合语音上下文(如音高、能量和性别)与转录文本,对语音情感数据进行标注。通过利用VQ-VAE将音频编码为离散特征,并采用 few-shot prompting 方法,该方法通过数据增强提升了语音情感识别(SER)性能,优于仅使用文本的LLM标注方法,并在IEMOCAP和MSP-IMPROV数据集上取得了最先进结果。
Despite recent advancements in speech emotion recognition (SER) models, state-of-the-art deep learning (DL) approaches face the challenge of the limited availability of annotated data. Large language models (LLMs) have revolutionised our understanding of natural language, introducing emergent properties that broaden comprehension in language, speech, and vision. This paper examines the potential of LLMs to annotate abundant speech data, aiming to enhance the state-of-the-art in SER. We evaluate this capability across various settings using publicly available speech emotion classification datasets. Leveraging ChatGPT, we experimentally demonstrate the promising role of LLMs in speech emotion data annotation. Our evaluation encompasses single-shot and few-shots scenarios, revealing performance variability in SER. Notably, we achieve improved results through data augmentation, incorporating ChatGPT-annotated samples into existing datasets. Our work uncovers new frontiers in speech emotion classification, highlighting the increasing significance of LLMs in this field moving forward.
研究动机与目标
- 探究大型语言模型(LLMs)是否能有效标注语音情感数据,以应对语音情感识别(SER)中人工标注数据集稀缺的问题。
- 通过整合音高、能量和性别等音频特征,克服仅依赖文本的LLM标注方法在上下文感知方面的局限性。
- 开发一种新型流程,将LLM与通过VQ-VAE获得的音频表征相结合,以提升SER中情感标注的准确性。
- 将LLM生成的标注结果与人工标注数据进行对比评估,检验其在SER模型数据增强中的实用性。
- 探讨在情感计算领域大规模数据标注中,使用LLM相较于人工标注在成本与准确率之间的权衡。
提出的方法
- 作者使用ChatGPT基于转录的语音内容生成情感标签,将文本作为零样本或少样本提示的输入。
- 提出一种新颖的音频上下文整合方法,将平均能量、音高和说话人性别信息整合到LLM提示中,以提升标注的相关性。
- 采用向量量化变分自编码器(VQ-VAE)将原始音频转换为固定长度的离散表征,随后作为音频上下文包含在提示中。
- 采用少样本提示设置,即在提示中提供少量已标注示例,以提升标注的一致性与准确性。
- 将LLM生成的标注用于增强现有的人工标注SER数据集(如IEMOCAP、MSP-IMPROV),随后对模型进行微调以评估性能提升。
- 通过标准SER指标(如准确率、F1分数)在测试集上评估性能,比较基于人工标注数据、LLM标注数据以及混合数据集训练的模型表现。
实验结果
研究问题
- RQ1当仅依赖转录文本时,ChatGPT等LLM能否有效标注语音情感数据?
- RQ2在LLM提示中引入音频特征(如音高、能量、性别)如何影响情感标注的质量?
- RQ3使用LLM生成的标注进行数据增强,在多大程度上能提升语音情感识别模型的性能?
- RQ4与零样本提示相比,少样本提示在标注一致性与模型性能方面表现如何?
- RQ5在语音情感数据标注中,使用LLM与人工标注相比,在成本与准确率之间存在何种权衡?
主要发现
- 仅依赖转录文本的LLM标注方法在语音情感识别任务中未能有效泛化,原因在于缺乏音频上下文。
- 在LLM提示中引入音频上下文(如音高、能量、性别)显著提升了标注质量与SER性能。
- 使用VQ-VAE将音频编码为离散特征,增强了LLM提示中音频上下文的表征能力,从而提升了情感预测的准确性。
- 与零样本提示相比,采用少量已标注示例的少样本提示显著提升了LLM生成标注的一致性与准确性。
- 使用LLM标注样本进行数据增强后,IEMOCAP与MSP-IMPROV数据集上的SER模型性能得到提升,部分情况下优于仅使用人工标注数据训练的模型。
- 使用ChatGPT标注IEMOCAP数据的成本约为30美元,相比人工标注显著降低,但存在准确率的权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。