Skip to main content
QUICK REVIEW

[论文解读] Zero-shot Transfer Learning for Semantic Parsing

Javid Dadashkarimi, Alexander R. Fabbri|arXiv (Cornell University)|Aug 27, 2018
Topic Modeling参考文献 23被引用 3
一句话总结

本文提出了一种零样本迁移学习框架,用于语义解析,采用共享编码器-解码器结构,并引入可学习的域映射矩阵,将跨域样本对齐至共享潜在空间。通过利用影响函数进行跨域对抗性攻击,识别并增强来自不相似域的有影响力训练样本,显著提升了在标记数据稀缺情况下的零样本性能,且在不增加模型参数量超过基线的前提下,实现了对词元和序列层面的性能提升。

ABSTRACT

While neural networks have shown impressive performance on large datasets, applying these models to tasks where little data is available remains a challenging problem. In this paper we propose to use feature transfer in a zero-shot experimental setting on the task of semantic parsing. We first introduce a new method for learning the shared space between multiple domains based on the prediction of the domain label for each example. Our experiments support the superiority of this method in a zero-shot experimental setting in terms of accuracy metrics compared to state-of-the-art techniques. In the second part of this paper we study the impact of individual domains and examples on semantic parsing performance. We use influence functions to this aim and investigate the sensitivity of domain-label classification loss on each example. Our findings reveal that cross-domain adversarial attacks identify useful examples for training even from the domains the least similar to the target domain. Augmenting our training data with these influential examples further boosts our accuracy at both the token and the sequence level.

研究动机与目标

  • 解决在标注数据稀缺的零样本设置下低资源语义解析的挑战。
  • 通过在多个语义解析域之间学习共享表示,提升跨域泛化能力。
  • 识别并利用来自不相似域的有影响力训练样本,以增强模型性能。
  • 在保持或提升低数据环境下准确率的同时,最小化参数增长。

提出的方法

  • 使用单一共享编码器和解码器,并引入可学习的权重矩阵 W_T,将每个样本映射到其所属域,实现参数高效的域自适应。
  • 模型最小化一个损失函数,以鼓励正确预测域标签,从而有效学习共享表示空间。
  • 应用影响函数量化单个样本对域分类损失的影响,识别最具影响力的训练实例。
  • 通过扰动一个域的样本并测量其对另一域的影响,执行跨域对抗性攻击,揭示域之间的非对称影响。
  • 通过从相关性较低的域(如将 atis 用于 calendar)中选择前 k 个最具影响力的样本进行数据增强,并重新训练模型,以提升零样本性能。
  • 通过 W_T 的行切片施加正则化约束,限制参数增长,保持模型效率。

实验结果

研究问题

  • RQ1与现有迁移学习基线相比,使用域映射矩阵的共享编码器-解码器能否在语义解析中实现更优的零样本性能?
  • RQ2单个样本和域对模型性能的贡献如何?哪些是最具影响力的?
  • RQ3即使目标域与源域最不相似,跨域对抗性攻击是否仍能识别出有用的训练样本?
  • RQ4使用来自遥远域的有影响力样本进行数据增强,能否提升零样本语义解析的准确率?
  • RQ5样本对模型性能的影响在域之间是否对称?还是某些方向的迁移更有效?

主要发现

  • 所提出的零样本 k*d 方法在零样本设置下,尽管参数量更少,仍优于当前最先进的共享编码器和共享解码器模型。
  • 在低数据环境下增加参数量会降低性能,证实了参数效率的优势。
  • 即使是最不相似的域(如将 atis 用于 calendar)也包含有影响力的样本,当这些样本被加入训练集后,可在词元和序列层面均提升性能。
  • 跨域对抗性攻击并非对称:影响在某一方向(如 atis → calendar)上更强,而反向则较弱,这一结论通过影响函数分析得到验证。
  • 基于影响度采样(从分布 p(常见样本)和 1−p(稀有样本)中采样)的数据增强方法可提升性能,尤其在 n ≤ 40 个训练样本时效果更显著。
  • 当移除最接近的域时,模型性能保持稳健(最大准确率下降),但移除最远的域时性能更敏感,表明域的实用性并非均匀分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。