[论文解读] UnifiedSKG: Unifying and Multi-Tasking Structured Knowledge Grounding with Text-to-Text Language Models
本文提出了UnifiedSKG,一个统一框架,将21种多样化的结构化知识接地(SKG)任务——涵盖语义解析、问答和文本到SQL——统一为基于T5模型的文本到文本格式。通过实现一致的数据、模型和评估协议,UnifiedSKG在所有任务上均实现了最先进性能,使用微调后的T5模型,并通过多任务前缀调优(prefix-tuning)显著提升性能,同时揭示了GPT-3和Codex等大语言模型在零样本和少样本SKG设置下的局限性。
Structured knowledge grounding (SKG) leverages structured knowledge to complete user requests, such as semantic parsing over databases and question answering over knowledge bases. Since the inputs and outputs of SKG tasks are heterogeneous, they have been studied separately by different communities, which limits systematic and compatible research on SKG. In this paper, we overcome this limitation by proposing the UnifiedSKG framework, which unifies 21 SKG tasks into a text-to-text format, aiming to promote systematic SKG research, instead of being exclusive to a single task, domain, or dataset. We use UnifiedSKG to benchmark T5 with different sizes and show that T5, with simple modifications when necessary, achieves state-of-the-art performance on almost all of the 21 tasks. We further demonstrate that multi-task prefix-tuning improves the performance on most tasks, largely improving the overall performance. UnifiedSKG also facilitates the investigation of zero-shot and few-shot learning, and we show that T0, GPT-3, and Codex struggle in zero-shot and few-shot learning for SKG. We also use UnifiedSKG to conduct a series of controlled experiments on structured knowledge encoding variants across SKG tasks. UnifiedSKG is easily extensible to more tasks, and it is open-sourced at https://github.com/hkunlp/unifiedskg.
研究动机与目标
- 为解决结构化知识接地(SKG)研究中的碎片化问题,统一跨不同领域和知识源的异构任务。
- 将SKG的数据集、模型、代码、实验和评估指标标准化为一个单一、可扩展的框架。
- 使用统一基准评估预训练语言模型(如T5)在多样化SKG任务上的表现。
- 研究多任务学习,特别是前缀调优(prefix-tuning)在提升SKG任务间泛化能力方面的有效性。
- 分析结构化知识编码的鲁棒性,以及大语言模型在SKG任务上的零样本/少样本能力。
提出的方法
- 将21个异构SKG任务转化为统一的文本到文本格式,其中输入为自然语言请求和结构化知识,输出为自然语言或可执行程序。
- 使用在单个任务上微调的T5模型,并结合约束解码或重排序以提高输出有效性和性能。
- 应用多任务前缀调优以在任务间共享知识并提升泛化能力,尤其对低资源任务有效。
- 设计受控实验,评估不同结构化知识编码策略对模型性能的影响。
- 在统一的SKG任务上,使用T0、GPT-3和Codex等大模型基准测试零样本和少样本能力。
- 进行综合错误分析,以识别输出生成中的失败模式及模型规模依赖性。
实验结果
研究问题
- RQ1统一的文本到文本框架能否有效标准化跨多个领域和知识源的多样化结构化知识接地任务?
- RQ2T5模型在使用单一统一训练与评估协议的情况下,能否在21个异构SKG任务中实现最先进性能?
- RQ3与单任务微调或标准多任务学习相比,多任务前缀调优是否能显著提升SKG任务的性能?
- RQ4T0、GPT-3、Codex等大语言模型在统一SKG基准上的零样本和少样本设置下表现如何?
- RQ5T5模型对结构化知识编码方式的变化有多敏感?何种编码模式能在各类任务中实现最稳健的性能?
主要发现
- 微调后的T5模型在21个SKG任务中的20个上达到最先进或接近最先进性能,展现出在多样化任务中的强大泛化能力。
- T5模型性能随模型规模提升而增强,T5-3B在Logic2Text和ToTTo等复杂任务上优于较小参数版本。
- 多任务前缀调优显著提升了大多数任务的性能,尤其在T5-base和T5-large上,表明SKG任务间存在有效的知识迁移。
- T0、GPT-3和Codex在SKG任务的零样本和少样本学习中表现不佳,表明这些模型对结构化知识接地固有的分布偏移不具鲁棒性。
- T5模型对结构化知识编码方式的变化表现出敏感性,不同编码格式在不同任务上的性能存在差异,凸显了任务特定编码策略的必要性。
- 错误分析显示,即使T5-3B也会生成无效输出;尽管更大模型可降低错误率,但无法完全消除结构或事实性错误。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。