[论文解读] CKBP v2: Better Annotation and Reasoning for Commonsense Knowledge Base Population
CKBP v2 引入了一个高质量、由专家标注的常识知识库构建评估基准,通过用专家标注替代众包标注,并引入多样化的对抗性样本,解决了 CKBP v1 中存在的局限性,提升了基准的代表性与挑战性。尽管采用了最先进模型(包括 ChatGPT 等大语言模型),性能依然较低,表明该任务仍极具挑战性。
Commonsense Knowledge Bases (CSKB) Population, which aims at automatically expanding knowledge in CSKBs with external resources, is an important yet hard task in NLP. Fang et al. (2021a) proposed a CSKB Population (CKBP) framework with an evaluation set CKBP v1. However, CKBP v1 relies on crowdsourced annotations that suffer from a considerable number of mislabeled answers, and the evaluationset lacks alignment with the external knowledge source due to random sampling. In this paper, we introduce CKBP v2, a new high-quality CSKB Population evaluation set that addresses the two aforementioned issues by employing domain experts as annotators and incorporating diversified adversarial samples to make the evaluation data more representative. We show that CKBP v2 serves as a challenging and representative evaluation dataset for the CSKB Population task, while its development set aids in selecting a population model that leads to improved knowledge acquisition for downstream commonsense reasoning. A better population model can also help acquire more informative commonsense knowledge as additional supervision signals for both generative commonsense inference and zero-shot commonsense question answering. Specifically, the question-answering model based on DeBERTa-v3-large (He et al., 2023b) even outperforms powerful large language models in a zero-shot setting, including ChatGPT and GPT-3.5.
研究动机与目标
- 为解决 CKBP v1 中依赖众包标注和随机采样所导致的质量差、代表性低的问题。
- 通过使用具备机器常识推理专长的自然语言处理研究人员进行专家标注,提升评估的可靠性。
- 通过引入基于自信大语言模型预测构建的对抗性样本,提升数据集的多样性与难度。
- 为未来常识知识库构建模型的评估建立一个更严格的新基准。
- 证明即使最先进的模型(包括 LLM)在分布外(OOD)和对抗性样本上仍表现不佳,凸显该任务的剩余难度。
提出的方法
- 从 CKBP v1 中随机采样 2.5k 个样本,以保持关系比例,确保表示均衡。
- 通过选择 KG-BERT 模型以高置信度(得分 ≥ 0.9)分类为合理的 ASER 三元组,生成 2.5k 个对抗性样本。
- 使用自相似 BLEU(self-BLEU)进行多样性过滤,确保对抗性样本在语义上具有差异性,避免冗余。
- 招募四位具备自然语言处理与常识推理经验的专家标注者,对全部 5k 个样本进行合理性标注。
- 在判别式模型中使用特殊标记 [r] 表示关系,并为零样本 LLM 推理适配提示格式。
- 在判别式模型(KG-BERT)和生成式模型(COMET、GPT2)上开展广泛实验,涵盖零样本和半监督设置。
实验结果
研究问题
- RQ1与众包标注相比,专家标注数据是否能显著提升常识知识库构建评估基准的可靠性和质量?
- RQ2包含对抗性构造样本是否能提升评估集的难度与代表性?
- RQ3最先进模型(包括 ChatGPT 等大语言模型)在新 CKBP v2 基准上的表现与 CKBP v1 相比如何?
- RQ4模型在常识推理中对分布外(OOD)和对抗性样本的泛化能力如何?
- RQ5模型预测中的关键失败模式是什么,导致其在未见或复杂常识场景下表现不佳?
主要发现
- CKBP v2 中仅包含 83 个数据噪声(artifacts),占 3,852 个词汇项的极低比例,其低频性未对评估集质量造成显著影响。
- OOD 子集的 F1 分数低于对抗性子集,原因在于 OOD 子集中合理样本比例较低,且对抗性子集的召回率更高。
- 尽管参数量更大,GPT2-large 与 GPT2-XL 表现相似,表明该任务中模型规模的收益递减。
- KG-BERT 在 AUC 上显著优于 COMET(GPT2),归因于其在正负三元组上同时进行训练,展现出更强的判别能力。
- 所有模型(包括 ChatGPT)在 OOD 泛化问题上均表现显著下降,表明其对未见常识场景的鲁棒性较差。
- 错误模式包括将语义相关但不合理的三元组误判为合理,以及错误拒绝包含未见实体或事件的合理三元组。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。