[论文解读] Modeling User Behaviour in Research Paper Recommendation System
该论文提出了一种结合LDA与Word2Vec的混合主题模型(HTM),通过捕捉词-主题的概率分布和词的语义相关性,准确识别研究论文的主题。随后,利用带有时间戳感知的时序上下文的LSTM序列模型,从点击历史中预测用户动态意图,在研究论文推荐任务中显著优于当前最先进方法。
User intention which often changes dynamically is considered to be an important factor for modeling users in the design of recommendation systems. Recent studies are starting to focus on predicting user intention (what users want) beyond user preference (what users like). In this work, a user intention model is proposed based on deep sequential topic analysis. The model predicts a user's intention in terms of the topic of interest. The Hybrid Topic Model (HTM) comprising Latent Dirichlet Allocation (LDA) and Word2Vec is proposed to derive the topic of interest of users and the history of preferences. HTM finds the true topics of papers estimating word-topic distribution which includes syntactic and semantic correlations among words. Next, to model user intention, a Long Short Term Memory (LSTM) based sequential deep learning model is proposed. This model takes into account temporal context, namely the time difference between clicks of two consecutive papers seen by a user. Extensive experiments with the real-world research paper dataset indicate that the proposed approach significantly outperforms the state-of-the-art methods. Further, the proposed approach introduces a new road map to model a user activity suitable for the design of a research paper recommendation system.
研究动机与目标
- 为解决研究论文推荐系统中静态用户偏好模型的局限性,通过建模动态用户意图来改进。
- 开发一种混合主题模型(HTM),通过整合概率主题分布与语义词相关性,克服传统主题模型(如LDA和Word2Vec)的不足。
- 利用序列深度学习(特别是LSTM)建模用户意图,将用户交互之间的时间戳差异作为时序上下文特征。
- 基于真实世界用户交互数据与用户调查,对所提方法与现有搜索引擎及推荐系统进行评估。
- 建立一种超越静态用户偏好的新框架,用于建模研究论文推荐系统中的动态用户行为。
提出的方法
- 提出一种混合主题模型(HTM),结合潜在狄利克雷分配(LDA)以获取主题分布,以及Word2Vec以捕捉词的语义与句法相关性。
- 利用HTM推断每篇研究论文的真实主题,通过估计反映词共现与语义相似性的词-主题分布。
- 通过识别点击论文的主题,从点击日志中提取用户偏好,构建基于兴趣主题的动态用户画像。
- 应用长短期记忆(LSTM)网络,基于主题交互的序列历史建模用户意图,将点击之间的时间间隔作为时序上下文特征。
- 训练LSTM模型,基于历史交互与时间上下文预测用户下一流感主题,实现短期与长期意图的联合建模。
- 将用户意图预测集成到推荐流水线中,每次会话后更新用户画像,并利用其生成个性化推荐。
实验结果
研究问题
- RQ1与独立使用LDA或Word2Vec相比,结合LDA与Word2Vec的混合主题模型是否能提升研究论文主题识别的准确性?
- RQ2在序列推荐系统中,引入时间上下文(时间戳差异)在多大程度上能提升用户意图预测性能?
- RQ3在用户中心指标(如Recall@10、Precision@10、MAP@10和CTR)方面,所提出的HTM-LSTM模型与当前最先进推荐系统相比表现如何?
- RQ4在研究论文推荐中,建模动态用户意图(用户当前想要什么)是否比仅建模静态用户偏好(用户喜欢什么)带来更好的推荐性能?
- RQ5所提出的框架是否能通过主题交互的序列建模,有效捕捉用户的短期与长期兴趣?
主要发现
- 所提出的混合主题模型(HTM)在研究论文主题分类任务中,优于单独使用LDA或Word2Vec,其优势源于同时利用概率主题分布与语义词相关性。
- 采用时间戳感知时序上下文的LSTM用户意图模型显著提升了推荐性能,达到Recall@10为0.72,CTR为0.248,优于基线模型。
- 用户评估显示,所提模型在用户感知相关性方面优于主流搜索引擎(Google Scholar、Microsoft Academic、Citeseer),在Recall@10与CTR上表现更优。
- 模型获得MAP@10为0.52,表明其排序质量优异,并在多个用户会话与多样化研究主题中表现出强鲁棒性。
- 将动态意图建模与点击历史的序列信息及时间上下文相结合,相较静态偏好模型,关键指标提升了15–20%。
- 用户调查确认,参与者更偏好本系统生成的推荐结果,而非传统搜索引擎,验证了其在真实使用场景中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。