Skip to main content
QUICK REVIEW

[论文解读] CST5: Data Augmentation for Code-Switched Semantic Parsing

Anmol Agarwal, Jigar Gupta|arXiv (Cornell University)|Nov 14, 2022
Natural Language Processing Techniques被引用 5
一句话总结

CST5 提出了一种数据增强技术,通过在少量种子数据集(约100对并行的英文-混合语句)上微调多语言 T5(mT5)模型,从单语英文语义解析数据中生成高质量、语义等价的混合语句。该方法实现了高达20倍的数据效率提升,仅使用100个种子样本即可达到使用2,000个标注样本训练的模型性能,同时发布了10,000个人工标注的印地语-英语混合语句(Hinglish-TOP)和170,000条合成混合语句。

ABSTRACT

Extending semantic parsers to code-switched input has been a challenging problem, primarily due to a lack of supervised training data. In this work, we introduce CST5, a new data augmentation technique that finetunes a T5 model using a small seed set ($\approx$100 utterances) to generate code-switched utterances from English utterances. We show that CST5 generates high quality code-switched data, both intrinsically (per human evaluation) and extrinsically by comparing baseline models which are trained without data augmentation to models which are trained with augmented data. Empirically we observe that using CST5, one can achieve the same semantic parsing performance by using up to 20x less labeled data. To aid further research in this area, we are also releasing (a) Hinglish-TOP, the largest human annotated code-switched semantic parsing dataset to date, containing 10k human annotated Hindi-English (Hinglish) code-switched utterances, and (b) Over 170K CST5 generated code-switched utterances from the TOPv2 dataset. Human evaluation shows that both the human annotated data as well as the CST5 generated data is of good quality.

研究动机与目标

  • 为解决印地语-英语等低资源语言对在语义解析任务中缺乏标注的混合语训练数据的问题。
  • 开发一种数据增强方法,利用少量并行英文-混合语句种子数据,生成合成的混合语数据。
  • 通过利用合成数据生成,显著减少对人工标注数据的依赖,从而提升语义解析性能。
  • 发布大规模、高质量的混合语语义解析数据集,以支持未来多语言 NLP 研究。

提出的方法

  • 在约100对并行(英文,混合语)语句对的小型种子数据集上微调多语言 T5(mT5)模型,以学习混合语模式。
  • 使用微调后的 mT5 模型从大规模单语英文语义解析数据集(如 TOPv2)中生成混合语句。
  • 将原始英文语句的语义解析结果与生成的混合语句对齐,以保留标签监督信号。
  • 通过过滤和人工评估确保生成数据在语义等价性和自然性方面达到高质量标准。
  • 在真实数据和合成数据上联合训练并评估语义解析器,以衡量性能提升。
  • 当缺乏并行数据时,通过机器翻译将方法扩展至其他语言对(如西班牙语-英语)的种子数据。

实验结果

研究问题

  • RQ1仅使用100对并行英文-混合语句的种子数据集,能否有效实现混合语语义解析的数据增强?
  • RQ2CST5 生成的合成混合语数据在语义等价性和自然性方面,与人工标注数据相比表现如何?
  • RQ3使用 CST5 进行数据增强后,为达到相当的语义解析性能,所需标注数据量能减少多少?
  • RQ4CST5 生成数据带来的性能增益是否在不同语义解析领域(尤其是低资源或复杂领域,如提醒类任务)中均成立?
  • RQ5CST5 是否能推广至印地语-英语以外的语言对(如西班牙语-英语),即使仅有极少并行数据?

主要发现

  • 仅使用100个种子样本,CST5 生成的数据即可使模型性能达到使用2,000个人工标注样本训练的模型水平,实现20倍的数据需求降低。
  • 使用 CST5 微调的 XXL mT5 模型相比无数据增强的基线模型,在精确匹配(EM)准确率上实现了25%的绝对提升。
  • 人工评估确认,89%的生成混合语句与原始英文语句在语义上等价,98%的语句被认为自然。
  • 使用 CST5 生成数据训练的模型收敛速度更快,表明其具有更高的数据效率并降低了样本复杂度。
  • 在 CSTOP 西班牙语-英语数据集上,CST5 仅使用100条合成样本,便将 EM 准确率从69.2%提升至77.8%,证明了其在印地语-英语之外语言对中的泛化能力。
  • 在复杂领域(如提醒类任务,包含16种意图,平均每条语句2.66个意图)中,CST5 表现更优,该领域数据稀缺性影响最大,性能增益尤为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。