[论文解读] Contextualized Scene Imagination for Generative Commonsense Reasoning
本文提出了一种想象与表述(I&V)框架,通过首先构想一个情境化场景知识图(SKG),捕捉输入概念之间的合理关系,然后基于SKG生成自然语言描述,从而增强生成式常识推理能力。该方法在概念到句子和概念到故事生成任务中提升了零样本和少样本性能,人工评估证实SKG反映了常识,且生成的文本与之对齐。
Humans use natural language to compose common concepts from their environment into plausible, day-to-day scene descriptions. However, such generative commonsense reasoning (GCSR) skills are lacking in state-of-the-art text generation methods. Descriptive sentences about arbitrary concepts generated by neural text generation models (e.g., pre-trained text-to-text Transformers) are often grammatically fluent but may not correspond to human common sense, largely due to their lack of mechanisms to capture concept relations, to identify implicit concepts, and to perform generalizable reasoning about unseen concept compositions. In this paper, we propose an Imagine-and-Verbalize (I&V) method, which learns to imagine a relational scene knowledge graph (SKG) with relations between the input concepts, and leverage the SKG as a constraint when generating a plausible scene description. We collect and harmonize a set of knowledge resources from different domains and modalities, providing a rich auxiliary supervision signal for I&V. The experiments demonstrate the effectiveness of I&V in improving language models on both concept-to-sentence and concept-to-story generation tasks, while enabling the model to learn well from fewer task examples and generate SKGs that make common sense to human annotators.
研究动机与目标
- 为解决神经文本生成模型中常识推理能力不足的问题,这些模型常生成语法正确但不合理的句子。
- 使模型能够推断输入中未明确提供的隐含概念及概念之间的合理关系。
- 将生成式常识推理分解为两个阶段:场景想象(SKG构建)与表述(自然语言生成)。
- 利用多样化、多模态知识源(如视觉字幕、故事)提供间接监督,以学习常识知识。
- 通过在生成前引入显式、结构化的推理步骤,提升少样本泛化能力和模型可解释性。
提出的方法
- I&V框架由两个模块组成:想象模块从输入概念和上下文构建情境化场景知识图(SKG),表述模块则基于SKG生成自然语言。
- 想象模块在来自多样化来源(如视觉字幕、故事数据集、ConceptNet)的大规模外部SKG集合上进行预训练,以学习合理概念关系。
- SKG是一种关系图,节点代表概念(包括隐含概念),边代表关系,如'CapableOf'、'UsedFor'或'LocatedAt'。
- 表述模块在下游GCSR数据集上进行微调,以基于想象出的SKG生成流畅且语义一致的句子。
- 该方法在两个模块中均使用预训练的文本到文本Transformer(如BART),想象模块利用多源、多模态SKG实现间接监督。
- 通过提供结构化、具备常识感知的监督,该框架实现了有效的少样本学习,使模型能泛化到未见过的概念组合。
实验结果
研究问题
- RQ1模型能否通过首先从输入概念构想出结构化的关联场景知识图(SKG),学习生成合理、具备常识感知的场景描述?
- RQ2整合来自多源、多模态SKG(如视觉字幕和故事)是否能提升生成描述的质量与常识一致性?
- RQ3想象模块在少样本设置下,对未见过的概念组合的泛化能力有多强?
- RQ4生成的SKG在多大程度上反映了人类常识?它们是否与最终生成的句子保持一致?
- RQ5模型能否识别并整合输入中未包含但对合理性至关重要的隐含概念(如'throw'对应'person')?
主要发现
- I&V框架在概念到句子和概念到故事生成任务上,性能达到或优于SotA基线模型。
- 从视觉字幕和故事数据集中提取的SKG提供了最有效的监督,显著提升了生成质量。
- 模型在较少训练样本下表现出更快的学习速度,证明结构化的想象步骤显著增强了少样本泛化能力。
- 人工评估显示,生成的SKG内容完整(包含所有必要概念)且符合常识,标注者间一致性为Fleiss Kappa = 0.21,表明评估结果为中等一致性。
- 表述模块始终能生成与想象SKG一致的句子,证实生成过程遵循了想象模块的引导。
- 采用更大语言模型主干的想象模块展现出更强的常识知识编码与推理能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。