[论文解读] Are "Undocumented Workers" the Same as "Illegal Aliens"? Disentangling Denotation and Connotation in Vector Spaces
本文提出一种对抗性神经网络,将预训练词嵌入解耦为独立的指称向量与内涵向量,从而实现对语义指称与情感的独立建模。在政治语言上的评估表明,该方法通过将意识形态内涵与事实性意义分离,提升了信息检索中的观点多样性。
In politics, neologisms are frequently invented for partisan objectives. For example, "undocumented workers" and "illegal aliens" refer to the same group of people (i.e., they have the same denotation), but they carry clearly different connotations. Examples like these have traditionally posed a challenge to reference-based semantic theories and led to increasing acceptance of alternative theories (e.g., Two-Factor Semantics) among philosophers and cognitive scientists. In NLP, however, popular pretrained models encode both denotation and connotation as one entangled representation. In this study, we propose an adversarial neural network that decomposes a pretrained representation as independent denotation and connotation representations. For intrinsic interpretability, we show that words with the same denotation but different connotations (e.g., "immigrants" vs. "aliens", "estate tax" vs. "death tax") move closer to each other in denotation space while moving further apart in connotation space. For extrinsic application, we train an information retrieval system with our disentangled representations and show that the denotation vectors improve the viewpoint diversity of document rankings.
研究动机与目标
- 为解决预训练词嵌入中指称与内涵的纠缠问题,该问题可能在NLP系统中强化政治偏见。
- 开发一种方法,将语义意义分离为独立且可解释的向量空间,分别表示指称(参考)与内涵(情感/意识形态)。
- 通过语义相似度与聚类等内在评估,以及信息检索任务的外在评估,验证解耦表示的有效性。
- 证明指称感知的表示可提升文档排序中的观点多样性,减少意识形态回音室效应。
- 通过使用发言者与参考标签作为监督信号,使模型扎根于现实世界的政治话语。
提出的方法
- 采用对抗性自编码器框架,将预训练词嵌入分解为两个独立的向量空间:一个用于指称,一个用于内涵。
- 模型使用两个判别器——一个用于指称,一个用于内涵——分别用于区分真实与生成的表示,以促进解耦。
- 损失函数结合了原始输入的重建损失以及指称与内涵的对抗损失,确保每个向量空间仅捕捉其预期的语义维度。
- 通过句子级别的标签提供监督:发言者意识形态(用于内涵)与政策主题(用于指称),用以引导解耦过程。
- 模型在带有政治话语标注的新闻语料上进行训练,使其能够学习参考意义与评价性语调之间的区别。
- 训练完成后,通过内在聚类与外在检索任务对指称与内涵向量进行评估,以验证其语义纯净度与实用性。
实验结果
研究问题
- RQ1能否通过对抗训练有效解耦预训练词嵌入,得到独立的指称与内涵表示?
- RQ2解耦后的指称向量是否能在同一政策的不同政治表述中保持一致的语义指称?
- RQ3解耦后的内涵向量是否能反映意识形态情感,同时保持事实性语义的完整性?
- RQ4指称向量能否提升信息检索系统中的观点多样性?
- RQ5该模型在向量空间中在多大程度上保留了已知的政治委婉语(如“无证移民”与“非法外国人”)?
主要发现
- 解耦后的指称空间中,语义指称相同但内涵不同的词对,其平均余弦相似度达到0.944,表明语义一致性较强。
- 内涵空间中,内涵相同但指称不同的词对,其平均余弦相似度达到0.904,表明情感维度被有效分离。
- 在信息检索任务中,基于指称的排序方法提升了观点多样性,α-nDCG得分为0.37,表明检索文档的多样性更高。
- 基于指称的方法下,文档排序的基尼系数降至0.153,证实了意识形态同质性的降低。
- 定性分析表明,“无证移民”与“非法外国人”在指称空间中更接近,但在内涵空间中更疏远,验证了模型的预期行为。
- 该模型成功实现了语义维度的解耦,无需显式定义,而是依赖上下文与发言者级别的监督信号。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。