[论文解读] Knowledge-driven Data Construction for Zero-shot Evaluation in Commonsense Question Answering
本文提出了一种神经符号框架,利用多种知识图谱(如 ConceptNet、ATOMIC)生成用于预训练语言模型的合成常识问题,从而在五个基准任务上实现稳健的零样本迁移。关键贡献在于证明:结合多个知识源、采用结构化问题生成与边际排序训练,可带来一致的性能提升,尤其在知识与任务特定推理需求高度对齐时效果更显著。
Recent developments in pre-trained neural language modeling have led to leaps in accuracy on commonsense question-answering benchmarks. However, there is increasing concern that models overfit to specific tasks, without learning to utilize external knowledge or perform general semantic reasoning. In contrast, zero-shot evaluations have shown promise as a more robust measure of a model's general reasoning abilities. In this paper, we propose a novel neuro-symbolic framework for zero-shot question answering across commonsense tasks. Guided by a set of hypotheses, the framework studies how to transform various pre-existing knowledge resources into a form that is most effective for pre-training models. We vary the set of language models, training regimes, knowledge sources, and data generation strategies, and measure their impact across tasks. Extending on prior work, we devise and compare four constrained distractor-sampling strategies. We provide empirical results across five commonsense question-answering tasks with data generated from five external knowledge resources. We show that, while an individual knowledge graph is better suited for specific tasks, a global knowledge graph brings consistent gains across different tasks. In addition, both preserving the structure of the task as well as generating fair and informative questions help language models learn more effectively.
研究动机与目标
- 解决在零样本常识问答中,知识源、数据生成策略与语言模型之间相互作用的系统性研究不足问题。
- 探究在合成的、知识驱动的 QA 数据上进行预训练,是否能提升在多样化常识推理任务上的泛化能力。
- 评估不同干扰项采样策略对零样本设置下模型性能与问题质量的影响。
- 确定结合多个知识图谱是否优于单独使用单一图谱,从而提升零样本迁移性能。
- 评估边际排序训练相较于标准语言建模,在预训练过程中保留任务结构方面的有效性。
提出的方法
- 通过使用特定任务模板,将五个外部知识资源(ATOMIC、ConceptNet、Wikidata、VisualGenome、CWWV)转换为问题-答案对,构建合成的多项选择题数据集。
- 实施四种受约束的干扰项采样策略:随机采样、对抗性过滤、混合采样(随机 + 对抗性)以及基于语义相似度的知识感知采样。
- 在合成数据集上,使用两种训练范式(标准语言建模与边际排序)对两种语言模型(GPT-2-Large 和 RoBERTa-Large)进行预训练。
- 在五个常识问答基准上评估零样本性能:SocialIQA、PhysicalIQA、CommonSenseQA、aNLI 和 HellaSwag。
- 通过人工评估来衡量问题的公平性与信息量,识别自动生成数据集中存在的模糊或无意义问题。
- 应用对抗性过滤以提升干扰项的可信度,并在公平性与信息量之间实现平衡。
实验结果
研究问题
- RQ1知识源的选择如何影响在多样化常识推理任务上的零样本性能?
- RQ2不同干扰项采样策略对合成数据生成中模型泛化能力与问题质量的影响如何?
- RQ3结合多个知识图谱是否能带来优于使用单一图谱的零样本迁移性能?
- RQ4与标准语言建模相比,边际排序预训练在保留任务结构与提升下游性能方面表现如何?
- RQ5自动生成的问题在多大程度上是公平且信息丰富的?与人工生成的问题相比,其难度如何?
主要发现
- 在合成的、知识驱动的 QA 数据上预训练语言模型,可在五个常识推理任务中实现可测量的零样本泛化性能提升。
- RoBERTa-Large 在所有任务中均优于 GPT-2-Large,在边际排序范式下,ATOMIC 上达到 45.9% 的准确率,CWWV 上达到 64.5%。
- 结合多个知识源可一致提升性能,全局知识图谱带来的增益优于单一图谱,尤其在知识与任务需求高度对齐时更为显著。
- 边际排序预训练优于标准语言建模,因其更好地保留了任务的结构完整性,并提升了零样本迁移准确率。
- 人工评估显示,尽管大多数生成问题对人类而言比对模型更简单(符合设计意图),但仍有相当一部分问题存在无意义或模糊不清的问题,表明自动问题生成的质量仍面临挑战。
- 混合干扰项采样策略(结合随机采样与对抗性采样)最为有效,在不使问题过于简单的前提下,平衡了可信度与信息量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。