[论文解读] Know Your Personalization: Learning Topic level Personalization in Online Services
本文提出一种黑箱方法,通过分析个性化内容输出与普通内容输出之间的差异,推断在线服务中的用户个性化配置文件,采用潜在主题个性化(LTP)模型。该方法在真实谷歌搜索数据中实现了84%的R-precision,用于识别个性化主题,使用户能够发现隐藏的配置信息,并支持隐私评估框架。
Online service platforms (OSPs), such as search engines, news-websites, ad-providers, etc., serve highly pe rsonalized content to the user, based on the profile extracted from his history with the OSP. Although personalization (generally) leads to a better user experience, it also raises privacy concerns for the user---he does not know what is present in his profile and more importantly, what is being used to per sonalize content for him. In this paper, we capture OSP's personalization for an user in a new data structure called the person alization vector ($η$), which is a weighted vector over a set of topics, and present techniques to compute it for users of an OSP. Our approach treats OSPs as black-boxes, and extracts $η$ by mining only their output, specifical ly, the personalized (for an user) and vanilla (without any user information) contents served, and the differences in these content. We formulate a new model called Latent Topic Personalization (LTP) that captures the personalization vector into a learning framework and present efficient inference algorithms for it. We do extensive experiments for search result personalization using both data from real Google users and synthetic datasets. Our results show high accuracy (R-pre = 84%) of LTP in finding personalized topics. For Google data, our qualitative results show how LTP can also identifies evidences---queries for results on a topic with high $η$ value were re-ranked. Finally, we show how our approach can be used to build a new Privacy evaluation framework focused at end-user privacy on commercial OSPs.
研究动机与目标
- 使终端用户能够发现在线服务平台(OSPs)如搜索引擎和推荐系统所维护的隐藏个性化配置文件。
- 开发一种无需访问内部算法或用户历史记录的方法,以提取用户兴趣配置文件,将OSPs视为黑箱。
- 提供一种实用的仅输出方法,通过比较个性化与普通内容输出,推断个性化主题权重。
- 通过检测政治倾向或医疗兴趣等敏感主题上的个性化,支持终端用户隐私研究。
- 为隐私保护工具的构建奠定基础,使用户能够审计并理解自身被个性化的机制。
提出的方法
- 该方法将个性化向量 η 构建为关于主题的加权向量,其中权重反映用户兴趣水平。
- 通过比较相同URL的个性化内容与普通内容(如搜索结果),检测排名变化,以识别基于主题的个性化。
- 潜在主题个性化(LTP)模型将个性化建模为关于主题分布的后验推断问题。
- LTP使用生成模型通过最大化跨查询观察到的排名差异似然性来推断 η。
- 该方法利用主题建模(如LDA风格)将主题定义为词语上的分布,从而实现对个性化的语义解释。
- 通过高效的优化算法执行推断,从排名变化中学习主题权重,而无需访问OSPs的内部逻辑。
实验结果
研究问题
- RQ1在无法访问内部算法或用户历史记录的情况下,能否推断出用户在在线服务中的个性化配置文件?
- RQ2个性化内容与普通内容之间的排名差异在多大程度上能揭示主题级的用户兴趣?
- RQ3黑箱方法在真实世界搜索数据中能多准确地恢复真实的个性化向量 η?
- RQ4推断出的个性化向量 η 是否能与已知的用户类别或兴趣产生有意义的相关性?
- RQ5该方法能否用于检测敏感或私密主题上的个性化,从而支持隐私评估?
主要发现
- LTP模型在真实谷歌搜索数据中实现84%的R-precision,用于识别个性化主题,证明了配置文件推断的高准确性。
- 对于单个用户,准确率在54%至85%之间波动,反映出不同用户个性化程度和一致性的差异。
- 该方法成功识别出在'算法'或'动漫与漫画'等主题上η值较高的用户,其结果排名相应调整,验证了模型的可解释性。
- LTP正确将高η主题与谷歌自身的类别标签匹配(例如,'动漫与漫画'对应η = 0.60),显示出与现实世界用户分类的一致性。
- 即使仅使用3名用户,该方法在基于推断个性化向量的用户分类中最高达到60%的准确率,表明其具有鲁棒性。
- 该方法使用户能够发现隐藏的个性化配置文件,为终端用户隐私意识提升和工具开发提供了全新路径。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。