[论文解读] CICERO: A Dataset for Contextualized Commonsense Inference in Dialogues
CICERO 是一个大规模、以对话为中心的数据集,包含 53,105 个上下文相关的常识推理,涵盖五种推理类型——原因、后续事件、先决条件、动机和情感反应,数据来源于 5,672 个对话对。该数据集支持生成式推理和多项选择任务等高级 NLP 任务,由于联合编码答案候选,序列到序列模型(T5、Unified QA)优于自回归模型(RoBERTa、ELECTRA)。
This paper addresses the problem of dialogue reasoning with contextualized commonsense inference. We curate CICERO, a dataset of dyadic conversations with five types of utterance-level reasoning-based inferences: cause, subsequent event, prerequisite, motivation, and emotional reaction. The dataset contains 53,105 of such inferences from 5,672 dialogues. We use this dataset to solve relevant generative and discriminative tasks: generation of cause and subsequent event; generation of prerequisite, motivation, and listener's emotional reaction; and selection of plausible alternatives. Our results ascertain the value of such dialogue-centric commonsense knowledge datasets. It is our hope that CICERO will open new research avenues into commonsense-based dialogue reasoning.
研究动机与目标
- 为解决对话中缺乏上下文感知的常识推理数据集的问题,特别是那些未在话语中明确表达的隐含推理。
- 创建一个大规模、人工标注的数据集,以捕捉超越孤立短语的、细致入微的对话级常识推理。
- 支持需要上下文推理的生成式和判别式任务,包括原因、动机和情感反应的推理。
- 使模型能够基于对话上下文推理隐含的、推测性的常识知识,而不仅仅是显式事实。
- 为评估对话推理系统在复杂、现实世界对话推理任务上的表现提供基准。
提出的方法
- 标注者会收到一个对话和一个目标话语,然后被要求为五种类型(原因、后续事件、先决条件、动机和情感反应)生成一句话的推理。
- 推理可以是显性的(在上下文中明确存在)或推测性的(当上下文不足时,基于常识和世界知识)。
- 该数据集通过遵循详细指南的人工标注者构建,确保语法正确、表达简洁,并与对话上下文保持一致。
- 任务围绕该数据集设计:生成式任务(如生成原因或情感反应)和判别式任务(如从多个选项中选择合理的替代项)。
- 模型通过单答案和多答案选择任务进行评估,其中 T5 和 Unified QA 用于序列到序列生成,RoBERTa 和 ELECTRA 用于序列分类。
- T5 和 Unified QA 中对候选答案的联合编码优于 RoBERTa 和 ELECTRA 中的独立编码,尤其在多答案设置中表现更优。
实验结果
研究问题
- RQ1当推理是隐含的时,模型能否有效生成对话话语中合理的常识推理(如原因、动机)?
- RQ2与独立编码相比,候选答案的联合编码在多项选择任务中如何提升性能?
- RQ3单答案与多答案实例之间的数据不平衡在多大程度上影响模型在常识推理任务上的表现?
- RQ4SOTA 模型如 T5 和 Unified QA 在对话特定的常识推理任务上,与 RoBERTa 和 ELECTRA 相比,泛化能力如何?
- RQ5基于对话上下文的常识知识是否能超越静态知识库(如 ConceptNet 或 ATOMIC)来提升推理能力?
主要发现
- 由于联合编码候选答案,T5 和 Unified QA 在多项选择答案选择任务中优于 RoBERTa 和 ELECTRA,从而捕获了更多与任务相关的信息。
- 模型之间的性能差距在多答案选择任务中最为显著,其中 T5 和 Unified QA 的精确匹配率分别为 3.38% 和 3.60%,这主要归因于数据不平衡。
- 序列到序列模型(T5、Unified QA)在相同任务上的表现显著优于序列分类模型(RoBERTa、ELECTRA),表明联合编码具有优势。
- 该数据集有效支持了对推测性常识推理的评估,标注者即使在对话中没有明确提及原因或动机的情况下,也能成功生成合理的推理。
- CICERO 表明,上下文感知的常识推理对于对话理解至关重要,依赖于上下文无关的知识库(如 ATOMIC 或 ConceptNet)的模型无法捕捉对话层面的细微差别。
- 通过人工标注的推测性推理构建数据集,表明此类推理在训练模型处理隐含的、现实世界的对话推理方面是可行且有价值的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。