[论文解读] Two-Level Transformer and Auxiliary Coherence Modeling for Improved Text Segmentation
本文提出CATS,一种基于两阶段Transformer的模型,通过多任务学习设置显式建模连贯性,从而提升文本分割性能。通过联合优化句子级分割与原始序列和打乱序列的区分任务,CATS在基准数据集上达到最先进性能,并利用跨语言嵌入实现有效的零样本跨语言迁移。
Breaking down the structure of long texts into semantically coherent segments makes the texts more readable and supports downstream applications like summarization and retrieval. Starting from an apparent link between text coherence and segmentation, we introduce a novel supervised model for text segmentation with simple but explicit coherence modeling. Our model -- a neural architecture consisting of two hierarchically connected Transformer networks -- is a multi-task learning model that couples the sentence-level segmentation objective with the coherence objective that differentiates correct sequences of sentences from corrupt ones. The proposed model, dubbed Coherence-Aware Text Segmentation (CATS), yields state-of-the-art segmentation performance on a collection of benchmark datasets. Furthermore, by coupling CATS with cross-lingual word embeddings, we demonstrate its effectiveness in zero-shot language transfer: it can successfully segment texts in languages unseen in training.
研究动机与目标
- 为解决现有文本分割模型通过词汇或语义相似性隐式捕捉连贯性,而非显式建模连贯性的问题。
- 通过引入一个辅助连贯性目标,区分原始句子序列与被破坏(打乱)的序列,从而提升分割性能。
- 通过利用仅在英语数据上训练的模型与跨语言词嵌入,实现文本分割的零样本语言迁移。
- 证明显式连贯性建模可同时提升分割准确率与在不同领域和语言间的鲁棒性。
提出的方法
- 该模型采用两阶段Transformer架构:标记级Transformer编码单个句子,句子级Transformer编码句子表示序列。
- 通过在上下文感知的句子表示上使用前馈分类器,在句子级别执行二元分割预测。
- 一个辅助连贯性回归器为整个文本片段预测一个连贯性得分,训练目标是为原始句子序列分配更高的得分,而非随机打乱的序列。
- 通过多任务学习进行模型训练,同时优化主分割目标和辅助连贯性目标。
- 该架构使用预训练词嵌入与位置嵌入拼接,句子表示从标记级Transformer中类似[CLS]的标记表示中提取。
- 在零样本迁移中,模型与跨语言词嵌入结合,无需微调即可实现在未见语言中的分割。
实验结果
研究问题
- RQ1显式连贯性建模是否能超越隐式连贯性信号,进一步提升文本分割性能?
- RQ2将分割与连贯性预测结合的多任务学习设置是否能带来更好的泛化能力与鲁棒性?
- RQ3仅在英语数据上训练的模型是否能通过跨语言词嵌入实现对低资源或未见语言的文本分割?
- RQ4该模型在多个基准测试中与最先进监督与无监督分割方法相比表现如何?
主要发现
- CATS在多个基准文本分割数据集上达到最先进性能,优于先前的监督模型。
- 辅助连贯性目标显著提升了分割性能,即使在推理阶段不使用该目标,其性能也优于基础的两阶段Transformer(TLT-TS)模型。
- 仅使用TLT-TS模型(无连贯性头)本身已达到最先进结果,证明了两阶段Transformer架构的有效性。
- CATS实现了有效的零样本跨语言分割:当与跨语言词嵌入结合时,其在未见语言上的表现优于最佳无监督模型。
- 该模型在领域迁移中表现出强鲁棒性,在多种文本类型与领域中均保持高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。