[论文解读] RevCore: Review-augmented Conversational Recommendation
本文提出 RevCore,一种端到端的对话推荐框架,通过整合情感一致的用户评论,提升物品推荐与对话响应生成的性能。通过检索与用户情感一致的评论,丰富物品表征,并采用评论注意力解码器,RevCore 在基准数据集上实现了推荐准确率和响应质量的显著提升。
Existing conversational recommendation (CR) systems usually suffer from insufficient item information when conducted on short dialogue history and unfamiliar items. Incorporating external information (e.g., reviews) is a potential solution to alleviate this problem. Given that reviews often provide a rich and detailed user experience on different interests, they are potential ideal resources for providing high-quality recommendations within an informative conversation. In this paper, we design a novel end-to-end framework, namely, Review-augmented Conversational Recommender (RevCore), where reviews are seamlessly incorporated to enrich item information and assist in generating both coherent and informative responses. In detail, we extract sentiment-consistent reviews, perform review-enriched and entity-based recommendations for item suggestions, as well as use a review-attentive encoder-decoder for response generation. Experimental results demonstrate the superiority of our approach in yielding better performance on both recommendation and conversation responding.
研究动机与目标
- 解决短对话中物品信息不足的问题,因上下文有限,用户偏好难以捕捉。
- 通过利用易于获取的丰富文本评论,而非成本高昂的知识图谱构建,克服现有基于知识图谱方法的局限性。
- 通过引入评论中的描述性与解释性内容,提升响应生成质量,使对话轮次更具信息量与连贯性。
- 通过将基于评论的用户反馈融合到物品表征与对话历史中,实现更准确、个性化的推荐。
- 证明情感感知的评论检索能显著提升基线模型在推荐与响应生成两方面的性能。
提出的方法
- 提出一种情感感知的评论检索模块,基于情感极性(正面/负面)将用户话语与评论匹配,确保相关性与一致性。
- 将检索到的评论整合到对话历史中,以丰富物品表征,通过评论增强的嵌入实现更优的用户偏好建模。
- 设计一种评论注意力编码器-解码器架构,在响应生成过程中关注关键评论句子,提升响应的连贯性与信息量。
- 在推荐组件中,结合基于实体的表征(如演员、类型)与评论嵌入,增强物品表征学习。
- 在对话上下文与评论内容之间应用交叉注意力机制,动态对齐生成过程中的相关信息。
- 采用多任务学习联合训练端到端框架,同时优化推荐与响应生成目标,兼顾 R@k 与响应流畅性(PPL、Dist-n)。
实验结果
研究问题
- RQ1在短对话、低信息量场景下,情感一致的评论能否提升推荐准确率?
- RQ2在对话推荐中,整合评论内容如何影响生成响应的流畅性与信息量?
- RQ3在 CR 任务中,情感感知的评论检索是否优于随机或非情感相关的检索策略?
- RQ4与领域特定的评论相比,主题无关的评论(如食品领域)在多大程度上会降低推荐性能?
- RQ5通过共享基于评论的知识,统一框架能否有效平衡推荐与对话生成?
主要发现
- RevCore 在推荐准确率方面实现显著提升,R@10 分数在基准数据集上相较强基线最高提升 12.3%。
- 模型生成的响应更具信息量与多样性,Dist-1 与 Dist-2 分数分别提升 8.7% 与 6.1%(相较于基线模型)。
- 情感感知的评论检索(C-S-S)优于基于有用性评分的检索(C-H-S),证明情感对齐在评论选择中的重要性。
- 随机匹配的评论(R-H-W)导致性能显著下降,R@k 下降超过 15%,PPL 上升,表明无关评论会损害推荐与生成效果。
- 使用主题无关的食品评论语料作为外部知识时,R@k 得分最低,证实领域一致性对有效评论整合至关重要。
- 消融实验表明,评论注意力解码器与评论增强的物品表征是关键组件,移除后性能下降 10%–14%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。