[论文解读] Large-scale Hierarchical Alignment for Data-driven Text Rewriting
本文提出大规模分层对齐(LHA),一种无监督方法,通过在预训练的句子和文档嵌入上进行分层最近邻搜索,从不同文本风格的单语语料库中提取伪平行句子对。该方法即使单独使用,也能在文本简化任务中取得具有竞争力的性能,表明大规模伪平行数据可有效替代或补充昂贵的平行语料库。
We propose a simple unsupervised method for extracting pseudo-parallel monolingual sentence pairs from comparable corpora representative of two different text styles, such as news articles and scientific papers. Our approach does not require a seed parallel corpus, but instead relies solely on hierarchical search over pre-trained embeddings of documents and sentences. We demonstrate the effectiveness of our method through automatic and extrinsic evaluation on text simplification from the normal to the Simple Wikipedia. We show that pseudo-parallel sentences extracted with our method not only supplement existing parallel data, but can even lead to competitive performance on their own.
研究动机与目标
- 解决文本重写任务(如简化和风格迁移)中平行单语语料库稀缺的问题。
- 开发一种无需任何种子平行数据或人工标注的无监督方法。
- 实现在可比语料库中大规模、高效且内存高效的语义对齐句子对提取。
- 评估仅使用伪平行数据是否能在文本重写任务中取得具有竞争力的性能。
- 通过自动评估和人工评估,证明该方法在文本简化任务中的有效性。
提出的方法
- LHA 执行分层最近邻搜索:首先基于预训练的文档嵌入在两个语料库之间对齐文档,然后使用句子嵌入在匹配的文档对内对齐句子。
- 该方法仅依赖预训练的句子和文档嵌入,无需微调或平行种子数据。
- 基于高语义相似性提取句子对,同时保留源语料库和目标语料库之间的风格差异。
- 该方法对噪声具有鲁棒性,并能高效扩展至包含数亿句子的语料库。
- 使用提取的伪平行对来预训练或微调神经机器翻译(NMT)模型以实现文本简化。
- 该方法在自动对齐基准和外部文本简化任务上均通过自动评估和人工评估进行了评估。
实验结果
研究问题
- RQ1是否可以无需任何平行种子数据,从单语可比语料库中有效提取伪平行句子对?
- RQ2LHA 在对齐不同文本风格(如新闻和科技写作)的句子方面表现如何?
- RQ3仅使用LHA提取的伪平行数据是否能在文本简化任务中取得与使用真实平行数据训练的模型相媲美甚至更优的性能?
- RQ4混合领域内和领域外的伪平行数据是否能提升文本简化任务的性能?
- RQ5在语法正确性、语义保留和简化程度方面,使用LHA生成数据训练的模型与基线模型相比表现如何?
主要发现
- LHA 仅使用预训练嵌入和分层最近邻搜索,成功从单语语料库中提取出高质量的伪平行句子对。
- 即使仅在伪平行数据上进行训练,该方法在文本简化任务中仍表现出具有竞争力的性能,其简化程度优于在27.2万条真实平行句子上训练的基线模型。
- 人工评估显示,使用混合伪平行数据(pseudo-all)训练的模型在简化度方面与参考的简单维基百科相当,平均简化度评分为0.77。
- 仅使用伪平行数据训练的模型(pseudo-all)在语法正确性方面得分为4.02,语义保留得分为2.96,表明尽管未使用真实平行数据,其质量仍可接受。
- 将领域内伪平行数据(wiki-simp-all)与领域外数据(wiki-news-all)结合使用可提升性能,表明领域特定对齐具有优势。
- 最佳模型(在真实与伪平行数据混合数据上训练,即 wiki-simp-65)在语义保留方面得分为3.76,略优于基线模型,且接近参考标准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。