[论文解读] TempoWiC: An Evaluation Benchmark for Detecting Meaning Shift in Social Media
TempoWiC 提出了一项新的基准,用于检测社交媒体中词语时间意义上的语义漂移,通过评估同一词语在不同时期的两则推文中的语义是否保持一致。尽管基于 Twitter 优化的模型表现强劲,该任务仍具挑战性,最佳的相似度方法优于微调方法,凸显了在 NLP 中需要更优的时间感知表征学习。
Language evolves over time, and word meaning changes accordingly. This is especially true in social media, since its dynamic nature leads to faster semantic shifts, making it challenging for NLP models to deal with new content and trends. However, the number of datasets and models that specifically address the dynamic nature of these social platforms is scarce. To bridge this gap, we present TempoWiC, a new benchmark especially aimed at accelerating research in social media-based meaning shift. Our results show that TempoWiC is a challenging benchmark, even for recently-released language models specialized in social media.
研究动机与目标
- 填补社交媒体词汇语义领域中真实世界、时间感知基准的空白,因为词语意义会因趋势而快速演变。
- 基于真实的 Twitter 趋势构建数据集,以评估模型在上下文中检测语义漂移的能力。
- 创建一个反映社交媒体语言动态性、非正式性和趋势驱动特性的挑战性评估基准。
- 提供稳健的基线和分析,为未来关于时间语义表示的研究奠定基础。
- 在不依赖预定义义项词典的设置下,实现对时间感知模型的评估,重点聚焦于语义一致性是否为二元判断。
提出的方法
- 从 1 亿条推文语料(2019–2021 年)中,利用月度频率和趋势得分,筛选出 210 个高趋势词语,以识别正在经历语义变化的词语。
- 在每个词语的峰值趋势日收集 100 条推文,并从一年前的同一天收集 100 条推文,形成用于对比的成对样本。
- 将任务定义为二分类:判断目标词语在两则时间上分离的推文中是否具有相同含义。
- 使用上下文嵌入语言模型(如 RoBERTa、BERTweet、TimeLMs)进行微调和基于句子嵌入相似度的分类。
- 使用保留的测试集评估模型性能,采用准确率和宏平均 F1 值,比较不同模型架构和训练策略的表现。
- 应用池化策略(平均池化、[CLS] 池化)处理句子嵌入,并开展消融研究,以评估表征技术的鲁棒性。
实验结果
研究问题
- RQ1当同一词语在不同时期的上下文中使用时,现有预训练语言模型在社交媒体中检测语义漂移的能力如何?
- RQ2在 TempoWiC 数据集上进行微调是否能提升性能,超过使用上下文嵌入的零样本相似度分类方法?
- RQ3Twitter 专用语言模型(如 BERTweet)在该时间语义漂移检测任务中,是否显著优于通用领域模型(如 RoBERTa)?
- RQ4性能在不同词语间是否存在显著差异?哪些因素(如频率、语义漂移程度)导致模型准确率高或低?
- RQ5在词语达到趋势峰值之前的数据上进行训练的模型,能否有效泛化到峰值之后的语义漂移检测任务?
主要发现
- 在 TempoWiC 上表现最佳的模型是基于 TimeLMs-2019-90M 的相似度方法,准确率达到 74.07%,宏平均 F1 为 70.33%,优于所有微调模型。
- 微调后的 BERTweet-large 模型准确率为 67.93%,宏平均 F1 为 60.62%,表明微调并不总是优于简单的相似度匹配。
- 基于相似度的方法泛化能力优于微调,表明上下文嵌入在检测细微语义漂移方面可能更具鲁棒性。
- 性能在不同词语间差异显著:例如,'delta' 的相似度方法准确率达 98.98%,而 'bullpen' 仅 38.38%,表明模型对词语特定的漂移模式敏感。
- 在 2019 年数据上训练的模型(TimeLMs-2019-90M)表现最佳,表明先前的时间表征可能比后期数据训练的模型更有效。
- 该任务仍极具挑战性,即使最佳模型也远未达到人类水平性能,表明时间感知 NLP 系统仍有巨大改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。