[论文解读] $R^3$: Reverse, Retrieve, and Rank for Sarcasm Generation with Commonsense Knowledge
本文提出 $R^3$,一种无监督反讽生成框架,通过反转情感极性、利用 COMET 检索常识知识,并使用微调后的 RoBERTa 模型生成的矛盾分数对检索到的语境进行排序。该方法在人工评估中 34% 的时间优于人类评判者,90% 的时间优于强化混合基线模型,通过整合情感极性反转与语义不一致,展现出更优的反讽质量。
We propose an unsupervised approach for sarcasm generation based on a non-sarcastic input sentence. Our method employs a retrieve-and-edit framework to instantiate two major characteristics of sarcasm: reversal of valence and semantic incongruity with the context which could include shared commonsense or world knowledge between the speaker and the listener. While prior works on sarcasm generation predominantly focus on context incongruity, we show that combining valence reversal and semantic incongruity based on the commonsense knowledge generates sarcasm of higher quality. Human evaluation shows that our system generates sarcasm better than human annotators 34% of the time, and better than a reinforced hybrid baseline 90% of the time.
研究动机与目标
- 为解决反讽生成中训练数据匮乏的问题,提出一种无监督框架。
- 利用常识知识建模多种反讽因素,包括情感极性反转与语义不一致。
- 通过整合检索到的常识语境以增强幽默感与不一致性,提升反讽质量。
- 在自动评估与人工评估中均优于现有基线模型与人工生成的反讽。
- 探究语义不一致在生成高质量反讽语句中的作用。
提出的方法
- 通过在输入句中对评价性词语应用否定或词义反义词,反转情感极性,生成反讽基础句。
- 使用 COMET(在 ConceptNet 上微调的语言模型)检索常识知识,生成相关语境概念。
- 通过将情感极性反转后的句子与检索到的常识句子拼接,构建候选反讽语句。
- 使用在多类型自然语言推理语料库上微调的矛盾检测模型,对候选语境进行排序,以衡量语义不一致程度。
- 基于矛盾分数选择得分最高的语境,并将其与情感极性反转后的句子拼接,生成最终输出。
- 采用固定生成模式:情感极性反转后的句子在前,随后为最高排名的常识语境。
实验结果
研究问题
- RQ1结合情感极性反转与基于常识的语义不一致,能否提升反讽生成质量?
- RQ2常识知识的整合在多大程度上影响了生成语句的幽默感与反讽感?
- RQ3与随机或非排序检索相比,基于矛盾的语境排序在多大程度上提升了反讽质量?
- RQ4该框架在人工评估中是否优于人工生成的反讽以及当前最先进基线模型?
- RQ5自动矛盾分数能否与人类对反讽程度与不一致性的判断相关联?
主要发现
- $R^3$ 模型生成的反讽在人工评估中,有 34% 的时间在反讽质量标准上优于人工生成的反讽。
- 在包括反讽、幽默与创造力在内的多个标准下,该模型在 90% 的人工评估中优于强化混合基线模型。
- 消融实验证明,情感极性反转与排序后的常识检索相结合,显著优于单一组件的表现。
- 当使用最佳排名的检索语境(FM 模型)时,人类对反讽的评分与自动矛盾分数之间观察到更高的皮尔逊相关系数,证实了不一致性在反讽感知中的作用。
- 尽管整体表现成功,但该模型偶尔会因随机检索的语境而生成比排序后语境更优的反讽,表明矛盾评分准确度存在局限。
- 模型性能对生成顺序敏感,在初步测试中,固定顺序(反转句在前)优于反转顺序,表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。