[论文解读] Discourse-Aware Soft Prompting for Text Generation
本文通过在前缀调优中引入分层屏蔽和稀疏注意力机制,提出了一种话语感知的软提示方法,显著提升了摘要生成和数据到文本生成任务中生成结果的连贯性、忠实度和相关性。该方法在低资源设置下性能与全量微调相当,优于标准前缀调优和现有基线模型,在自动评估与人工评估中均表现更优。
Current efficient fine-tuning methods (e.g., adapters, prefix-tuning, etc.) have optimized conditional text generation via training a small set of extra parameters of the neural language model, while freezing the rest for efficiency. While showing strong performance on some generation tasks, they don't generalize across all generation tasks. We show that soft-prompt based conditional text generation can be improved with simple and efficient methods that simulate modeling the discourse structure of human written text. We investigate two design choices: First, we apply extit{hierarchical blocking} on the prefix parameters to simulate a higher-level discourse structure of human written text. Second, we apply extit{attention sparsity} on the prefix parameters at different layers of the network and learn sparse transformations on the softmax-function. We show that structured design of prefix parameters yields more coherent, faithful and relevant generations than the baseline prefix-tuning on all generation tasks.
研究动机与目标
- 为了提升前缀调优在多样化文本生成任务中的泛化能力,特别是抽象摘要生成和数据到文本生成任务。
- 为了探究通过结构化前缀参数设计建模话语结构是否能提升生成质量。
- 为了评估注意力稀疏性对前缀参数的影响,以实现更优的特征选择与性能表现。
- 在保持参数效率的同时,实现与全量微调相当的强性能。
- 在标注数据有限的低资源设置下,展示方法的鲁棒性。
提出的方法
- 引入前缀参数的分层屏蔽机制,将不同前缀集合分配给不同Transformer层中的输入和输出段,以模拟话语结构。
- 采用层特定的前缀调优,调整不同层的前缀大小,发现高层对性能影响更大。
- 通过用稀疏替代品替换标准softmax,将稀疏性引入前缀调优模型的自注意力机制,而无需增加参数数量。
- 利用谱分析验证稀疏前缀参数相较于密集参数更能识别关键特征。
- 使用结构化前缀参数和稀疏注意力训练模型,保持主干模型权重冻结,仅微调软提示部分。
- 通过自动指标(ROUGE)和人工评估(连贯性、忠实度、相关性、语法正确性及整体质量)评估性能。
实验结果
研究问题
- RQ1Transformer网络的不同层是否以不同的效率处理前缀参数?
- RQ2前缀参数的分层屏蔽能否模拟人类话语结构并提升生成质量?
- RQ3在前缀参数上应用注意力稀疏性是否能增强特征表示与模型性能?
- RQ4话语感知的软提示在多样化文本生成任务中,尤其是在低资源设置下的泛化能力如何?
- RQ5结构化前缀调优能否在保持参数效率的同时,实现与全量微调相当的性能?
主要发现
- 分层屏蔽(HierBlock)与稀疏注意力(HierBlock+SA)在所有自动指标上显著优于标准前缀调优,ROUGE-1、ROUGE-2和ROUGE-L得分持续更高。
- 在XSUM和Wikihow摘要任务中,当训练数据少于50%时,HierBlock与HierBlock+SA在ROUGE-1和ROUGE-2上优于全量微调。
- 人工评估显示,HierBlock与HierBlock+SA在事实性与连贯性方面优于前缀调优,多数评估标准具有p < .05的显著性差异。
- 在低资源设置下,HierBlock+SA在多个指标上表现出比前缀调优和全量微调更稳定的性能。
- 在数据到文本生成任务中,所提模型性能与全量微调相当,且在人工评估中摘要生成任务表现略超全量微调。
- 谱分析证实,稀疏前缀参数相较于密集参数更能有效识别关键特征,支持了稀疏性设计的选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。