[论文解读] Multiview Contextual Commonsense Inference: A New Dataset and Task
本文介绍了 CICERO v2,一个包含 8,351 个由人类标注的多视角常识推理样本的数据集,涵盖对话中四个维度——原因、后续事件、动机和反应。该研究提出 DIALeCT,一种使用新型预训练目标(如概念去噪和话语排序)微调的 T5-Large 模型,在低资源设置下相比微调后的 T5-Large 模型表现出一致的性能提升,尤其在仅使用 20% 训练数据时,准确率提升超过 5%。
Contextual commonsense inference is the task of generating various types of explanations around the events in a dyadic dialogue, including cause, motivation, emotional reaction, and others. Producing a coherent and non-trivial explanation requires awareness of the dialogue's structure and of how an event is grounded in the context. In this work, we create CICEROv2, a dataset consisting of 8,351 instances from 2,379 dialogues, containing multiple human-written answers for each contextual commonsense inference question, representing a type of explanation on cause, subsequent event, motivation, and emotional reaction. We show that the inferences in CICEROv2 are more semantically diverse than other contextual commonsense inference datasets. To solve the inference task, we propose a collection of pre-training objectives, including concept denoising and utterance sorting to prepare a pre-trained model for the downstream contextual commonsense inference task. Our results show that the proposed pre-training objectives are effective at adapting the pre-trained T5-Large model for the contextual commonsense inference task.
研究动机与目标
- 为解决对话中高质量、多样化、由人类标注的常识推理样本的缺乏,特别是针对多视角推理的问题。
- 克服现有数据集依赖对抗性过滤、多样性低的模型生成解释而非多个独立的人类撰写答案的局限性。
- 开发一种预训练框架,使语言模型具备更深层次的常识推理能力,以提升对话理解能力。
- 评估常识感知预训练目标在标注数据稀缺的低资源设置下的有效性。
- 通过专为多视角、非平凡解释设计的数据集与模型架构,实现更鲁棒、更多样化的对话常识推理。
提出的方法
- CICERO v2 从三个高质量对话数据集——DailyDialog、MuTual 和 DREAM——构建,通过收集每个上下文推理问题的多个独立人类标注解释。
- 该数据集包含 8,351 个样本,分布在 2,379 个对话中,涵盖四种推理类型:原因、后续事件、动机和情感反应。
- DIALeCT 在 CICERO 上使用新型目标进行预训练:通过概念去噪恢复被掩码的常识概念,以及通过话语排序学习对话结构与连贯性。
- 这些预训练目标旨在增强模型对上下文定位和常识知识的感知能力,从而提升对对话历史的推理能力。
- 预训练完成后,DIALeCT 在多视角常识推理任务上进行微调,从候选答案集中选择多个正确答案。
- 通过仅使用 20% 的训练数据进行训练,评估模型在低资源条件下的表现,验证其鲁棒性与泛化能力。
实验结果
研究问题
- RQ1当使用对话特定、常识感知的预训练目标而非标准微调时,大型语言模型是否能在多视角常识推理任务上取得更优表现?
- RQ2CICERO v2 中人类标注推理的语义多样性与现有数据集相比如何,特别是在非冗余性和合理性方面?
- RQ3概念去噪与话语排序预训练目标在多视角常识推理下游任务上的表现提升程度如何?
- RQ4在标注数据有限的低资源设置下,此类预训练是否能带来更好的泛化能力?
- RQ5在极少量微调数据下,基于对话特定常识目标预训练的模型是否仍能超越标准的 T5-Large 模型?
主要发现
- CICERO v2 包含来自 2,379 个对话的 8,351 个样本,每个样本均有多项独立的人类标注解释,其语义多样性显著高于以往数据集。
- 使用概念去噪与话语排序目标进行预训练的 DIALeCT 模型,在仅使用 20% 训练数据微调时,相比 T5-Large 模型准确率提升超过 5%。
- 在多答案选择任务中,DIALeCT 在低资源条件下仍保持强劲表现,其准确率下降 20%,而 T5-Large 在相同数据比例下仅下降 5%。
- 预训练目标有效将常识知识编码进模型,表现为在所有四种推理类型(原因、后续事件、动机、反应)中均实现一致的准确率提升。
- 模型的性能增益在低资源设置下最为显著,表明 DIALeCT 学习到了比标准微调更鲁棒、更具泛化能力的推理模式。
- DIALeCT 在所有评估设置下均优于 T5-Large 基线模型,表明所提出的预训练目标对对话中多视角常识推理具有显著有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。