[论文解读] Improved Representation Learning for Predicting Commonsense Ontologies
本文提出了两种对顺序嵌入模型的扩展,以提升常识本体学习的效果:(1) 联合训练原始文本以增强层次关系预测;(2) 整合从本体偏序结构中推导出的长程连接与汇合约束。联合模型在ConceptNet和MCG上的准确率从92.0%提升至93.0%,而约束增强模型在WordNet上的性能从90.6%提升至91.3%,表明结构化监督与非结构化文本在学习一致且可泛化的表示方面具有重要价值。
Recent work in learning ontologies (hierarchical and partially-ordered structures) has leveraged the intrinsic geometry of spaces of learned representations to make predictions that automatically obey complex structural constraints. We explore two extensions of one such model, the order-embedding model for hierarchical relation learning, with an aim towards improved performance on text data for commonsense knowledge representation. Our first model jointly learns ordering relations and non-hierarchical knowledge in the form of raw text. Our second extension exploits the partial order structure of the training data to find long-distance triplet constraints among embeddings which are poorly enforced by the pairwise training procedure. We find that both incorporating free text and augmented training constraints improve over the original order-embedding model and other strong baselines.
研究动机与目标
- 通过联合建模层次关系与非结构化文本,提升常识本体的表示学习效果。
- 通过引入源自本体偏序结构的长程三元组约束,解决顺序嵌入中成对训练的局限性。
- 通过全局结构化监督提升模型在预测Is-A关系时的泛化能力与一致性。
- 在统一学习框架中评估自由文本监督与格子约束相结合的有效性。
提出的方法
- 使用其各自损失函数的加权组合,联合训练顺序嵌入与基于CBOW的文本嵌入:$ L_{\text{Joint}} = \alpha_1 L_{\text{Order}} + \alpha_2 L_{\text{CBOW}} $。
- 将多词短语表示为其组成词嵌入的平均值,以处理ConceptNet和MCG中的复合术语。
- 通过本体偏序结构的传递闭包生成额外的训练样本,以提升泛化能力。
- 通过强制两个嵌入的向量最大值(连接)与最小值(汇合)近似其在格中的最小上界与最大下界,引入连接与汇合约束。
- 定义连接与汇合的损失函数:$ d_c = \| \max(0, w_1 \vee w_2 - w_c) \|^2 $ 与 $ d_p = \| \max(0, w_p - w_1 \wedge w_2) \|^2 $,并采用基于边距的排序损失进行训练。
- 对所有实验使用Adam优化器,采用50维嵌入,并在开发集上调整超参数。
实验结果
研究问题
- RQ1联合学习顺序嵌入与非结构化文本是否能提升常识Is-A关系预测的性能?
- RQ2将源自本体格结构的长程三元组约束引入是否能增强顺序嵌入的泛化能力?
- RQ3与基线模型相比,文本监督与格子约束的联合效应在准确率与鲁棒性方面表现如何?
- RQ4该顺序嵌入框架能否有效扩展以处理现实世界知识库中的复杂多词实体与偏序结构?
主要发现
- 联合顺序嵌入与CBOW模型在ConceptNet和MCG的Is-A关系数据集上达到93.0%的准确率,较基线顺序嵌入模型(92.0%)提升1.0个百分点。
- 在较小的Data2划分上,联合模型的准确率从基线OE的78.1%提升至80.4%,即使在标注数据有限的情况下也表现出一致的增益。
- 引入连接与汇合约束后,顺序嵌入模型在WordNet上的准确率从90.6%提升至91.3%,证明了全局结构化监督的优势。
- 同时结合文本与格子约束的模型优于强基线模型(如双线性分类器与word2gauss),表明多源监督的有效性。
- 当标注数据稀缺时,文本监督带来的增益尤为显著,表明非结构化文本为少样本学习提供了宝贵的归纳偏置。
- 该方法成功利用了嵌入空间的内在几何结构,以强制实现传递性与基于格的推理,从而实现一致且全局一致的预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。