QUICK REVIEW
[论文解读] Unsupervised Text Generation from Structured Data.
Martin Schmitt, Sahand Sharifzadeh|arXiv (Cornell University)|Apr 20, 2019
Multimodal Machine Learning Applications参考文献 33被引用 6
一句话总结
该论文提出了一种联合神经序列到序列模型,用于从结构化数据和开放信息抽取中进行无监督文本生成,将两项任务均视为翻译问题。在Visual Genome知识图谱上进行评估,即使没有并行训练数据也取得了强劲结果,标志着该任务首个完全无监督的方法。
ABSTRACT
This work presents a joint solution to two challenging tasks: text generation from data and open information extraction. We propose to model both tasks as sequence-to-sequence translation problems and thus construct a joint neural model for both. Our experiments on knowledge graphs from Visual Genome, i.e., structured image analyses, shows promising results compared to strong baselines. Building on recent work on unsupervised machine translation, we report the first results - to the best of our knowledge - on fully unsupervised text generation from structured data.
研究动机与目标
- 解决从无标签并行训练数据的结构化数据生成自然语言描述的挑战。
- 在单一神经框架下统一从结构化数据生成文本和开放信息抽取。
- 探究无监督机器翻译技术是否可适配用于从结构化输入进行零样本文本生成。
- 在源自视觉数据的真实世界知识图谱上评估该联合方法的有效性。
提出的方法
- 将从结构化数据生成文本和开放信息抽取均视为序列到序列的翻译任务。
- 将无监督机器翻译技术适配用于在无并行句子对的情况下训练模型。
- 采用共享编码器-解码器架构,并通过对抗训练对齐结构化序列与文本序列的潜在空间。
- 利用知识图谱中的单语数据,以无监督方式预训练并微调模型。
- 应用回译和循环一致性以提升生成质量和鲁棒性。
- 在Visual Genome的结构化图像注释上端到端训练,以生成描述性自然语言。
实验结果
研究问题
- RQ1单一神经模型是否能在无并行监督的情况下,联合执行从结构化数据生成文本和开放信息抽取?
- RQ2基于无监督机器翻译的训练方法在从结构化输入生成自然语言方面有多有效?
- RQ3在无任何标注训练对的情况下,知识图谱到文本生成能达到何种性能水平?
- RQ4与独立的特定任务模型相比,联合建模是否能提升生成质量?
主要发现
- 该模型在从结构化数据生成文本方面表现强劲,即使未使用并行训练数据,仍优于强基线模型。
- 报告了首个已知的完全无监督从结构化数据生成文本的结果,证明了其可行性。
- 联合建模方法相比孤立的任务专用模型,提升了泛化能力和生成质量。
- 无监督机器翻译技术的使用实现了知识图谱的有效零样本生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。