[论文解读] Batch Clustering for Multilingual News Streaming
本文提出了一种基于批次的多语言新闻流聚类系统,通过一种新颖的“重播”策略扩展了 newsLens,以跨时间链接单语主题,并使用微调的 SBERT 嵌入向量创建跨语言故事。该系统在西班牙语和德语的单语聚类任务中达到最先进水平,在英语、西班牙语和德语新闻数据集的跨语言聚类任务中也表现优异。
Nowadays, digital news articles are widely available, published by various editors and often written in different languages. This large volume of diverse and unorganized information makes human reading very difficult or almost impossible. This leads to a need for algorithms able to arrange high amount of multilingual news into stories. To this purpose, we extend previous works on Topic Detection and Tracking, and propose a new system inspired from newsLens. We process articles per batch, looking for monolingual local topics which are then linked across time and languages. Here, we introduce a novel "replaying" strategy to link monolingual local topics into stories. Besides, we propose new fine tuned multilingual embedding using SBERT to create crosslingual stories. Our system gives monolingual state-of-the-art results on dataset of Spanish and German news and crosslingual state-of-the-art results on English, Spanish and German news.
研究动机与目标
- 为解决大规模多语言新闻流组织成连贯故事以支持实时决策的挑战。
- 扩展 newsLens 框架以支持多语言新闻聚类,同时保持可扩展性和效率。
- 通过引入一种新颖的重播策略,实现单语主题在时间与语言上的跨时追踪。
- 通过微调的多语言句子嵌入向量提升跨语言故事形成效果。
- 在多语言新闻的单语和跨语言聚类基准上均实现最先进性能。
提出的方法
- 将新闻文章按时间窗口分批处理,使用 TF-IDF 加权的词袋表示法构建局部单语主题。
- 在基于标题、正文和合并文本的 TF-IDF 子向量(实体、词素、词元)余弦相似度构建的相似度图上应用社区检测算法(Louvain)。
- 引入一种“重播”策略,通过相似度阈值比较主题中心点,实现跨批次的单语主题链接。
- 使用 SBERT 三元组网络微调 DistilBERT,生成多语言句子嵌入向量,用于跨语言故事链接。
- 通过在多语言潜在空间中将嵌入向量距离在阈值内的单语故事进行分组,实现多语言故事聚类。
- 使用标准 F1、BCubed F1、精确率和召回率指标评估在 Miranda 等人多语言基准数据集上的性能。
实验结果
研究问题
- RQ1基于批次的处理方法是否能有效链接时间跨度内的单语新闻主题,同时保持可扩展性和准确性?
- RQ2与现有方法相比,主题链接的“重播”策略在聚类质量与计算效率方面表现如何?
- RQ3与基线多语言表示相比,微调的 SBERT 嵌入向量在多大程度上提升了跨语言故事聚类效果?
- RQ4所提出的系统是否在单语和跨语言新闻聚类基准上优于最先进方法?
- RQ5在多语言新闻聚类流程中,TF-IDF 表示与密集嵌入向量相比表现如何?
主要发现
- 在西班牙语(97.68)和德语(98.70)测试集上,系统实现了最先进水平的单语 F1 分数,分别超过 Miranda 等人 1.51 和 1.08 分。
- 在英语上,系统在 BCubed F1(93.86)中排名第二,并取得最高的标准 F1(98.31),在精确率上优于 newsLens,与 Staykovski 等人持平。
- 系统在跨语言 BCubed F1 得分为 82.06,标准 F1 为 86.49,相比 Miranda 等人的 84.0 提升了 +2.5 分。
- 仅有 2% 的文章被重播,表明系统高效复用已有聚类,而非从零开始重新聚类。
- 使用微调的 SBERT 嵌入向量显著提升了跨语言故事形成效果,实现了更好的跨语言对齐。
- 与基线系统相比,系统生成的聚类数量更合理(英语 298 个,西班牙语 267 个,德语 205 个),表明聚类更具稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。