[论文解读] Language Models as Knowledge Bases: On Entity Representations, Storage Capacity, and Paraphrased Queries
本文研究了使用大型语言模型(LMs)作为可扩展、可通过自然语言访问的知识库的可行性,通过提出三种实体表示方法——符号化、表面形式和连续嵌入——实现数百万个实体和事实的存储。实验表明,LMs 可以以 79% 的准确率记忆多达 500 万个 Wikidata 三元组,并在零样本和少样本设置下有效实现对改写查询的知识迁移,证明 LMs 可作为结构化知识库在自然语言查询中的可行替代方案。
Pretrained language models have been suggested as a possible alternative or complement to structured knowledge bases. However, this emerging LM-as-KB paradigm has so far only been considered in a very limited setting, which only allows handling 21k entities whose single-token name is found in common LM vocabularies. Furthermore, the main benefit of this paradigm, namely querying the KB using a variety of natural language paraphrases, is underexplored so far. Here, we formulate two basic requirements for treating LMs as KBs: (i) the ability to store a large number facts involving a large number of entities and (ii) the ability to query stored facts. We explore three entity representations that allow LMs to represent millions of entities and present a detailed case study on paraphrased querying of world knowledge in LMs, thereby providing a proof-of-concept that language models can indeed serve as knowledge bases.
研究动机与目标
- 为解决现有 LM-as-KB 方法仅能处理约 21,000 个实体的局限性,这是由于词汇表限制所致。
- 评估并比较三种实体表示方法,以实现将 LMs 扩展至数百万个实体。
- 通过合成数据,实证估计当前 LM 架构在存储世界知识事实方面的容量上限。
- 研究在改写查询下知识检索的鲁棒性,包括零样本和少样本迁移。
- 提供一个概念验证,证明 LMs 可作为功能完整、可通过自然语言访问的知识库。
提出的方法
- 提出三种实体表示策略:符号化(扩展 LM 词汇表)、表面形式(使用子词编码的名称并配合序列解码器)和连续(从预训练特征中学习的嵌入)。
- 使用合成关系三元组(主语-谓词-宾语)来训练 LMs,使其在给定主语和谓词时预测宾语标记,从而模拟知识库的存储。
- 以 RoBERTa-base 作为基础 LM,并在不同规模的合成知识图上进行微调,以测量记忆准确率。
- 应用特定于特征的自编码器,从 Wikidata 特征(文本、定量、类型)中学习密集的实体嵌入,将其压缩为 64 维向量。
- 通过生成改写查询来评估零样本和少样本迁移,并在不微调或仅对查询变体进行少量微调的情况下测量模型性能。
- 使用余弦相似度损失在单位超球面上训练实体嵌入,以确保优化稳定并提升记忆效果。
实验结果
研究问题
- RQ1语言模型是否能够有效存储并检索涉及数百万个实体、超出标准词汇表限制的事实?
- RQ2当前 LM 架构在事实存储方面的容量上限是多少?其容量如何随模型规模扩展?
- RQ3LM 在未微调(零样本)和少量微调(少样本)情况下,对改写查询的泛化能力如何?
- RQ4不同实体表示方法在 LM-as-KB 系统中如何在准确率、效率和数据需求之间进行权衡?
- RQ5知识图的结构类型(例如 Erdos-Renyi 与 Barabasi-Albert)是否会影响其在 LMs 中的记忆能力?
主要发现
- 一个参数量为 125M 的 Transformer 模型可实现 95% 准确率记忆 100 万个 Wikidata 三元组,或以 79% 准确率记忆 500 万个三元组,表明其在更大模型上具备可扩展性。
- 符号化实体表示方法达到最高记忆准确率,但需要实体链接的训练数据,且计算成本较高。
- 表面形式表示方法计算效率高,且无需实体链接数据,但当实体名称较长时准确率下降。
- 当与预训练特征编码器和固定嵌入结合时,连续实体嵌入提供了良好的平衡——高效且准确。
- 对高度相似的改写查询,零样本迁移效果良好;而通过少量微调(5–100 个样本),可实现对不那么相似查询的稳健检索。
- 在相同参数预算下,具有无标度(Barabasi-Albert)拓扑结构的知识图比均匀(Erdos-Renyi)图更难被记忆。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。