Skip to main content
QUICK REVIEW

[论文解读] Semi-metric Behavior in Document Networks and its Application to Recommendation Systems

Luís M. Rocha|ArXiv.org|Sep 9, 2003
Recommender Systems and Techniques参考文献 30被引用 22
一句话总结

本文引入半度量距离图来建模数字图书馆和网络等文档网络中的关联关系,利用比率量化半度量行为以识别隐含关联。提出一种基于区间值模糊集与Dempster-Shafer证据理论的证据融合算法,用于在名为TalkMine的推荐系统中整合多源距离数据,通过稳健融合异构证据提升推荐准确性。

ABSTRACT

Recommendation systems for different Document Networks (DN) such as the World Wide Web (WWW) and Digital Libraries, often use distance functions extracted from relationships among documents and keywords. For instance, documents in the WWW are related via a hyperlink network, while documents in bibliographic databases are related by citation and collaboration networks. Furthermore, documents are related to keyterms. The distance functions computed from these relations establish associative networks among items of the DN, referred to as Distance Graphs, which allow recommendation systems to identify relevant associations for individual users. However, modern recommendation systems need to integrate associative data from multiple sources such as different databases, web sites, and even other users. Thus, we are presented with a problem of combining evidence (about associations between items) from different sources characterized by distance functions. In this paper we describe our work on (1) inferring relevant associations from, as well as characterizing, semi-metric distance graphs and (2) combining evidence from different distance graphs in a recommendation system. Regarding (1), we present the idea of semi-metric distance graphs, and introduce ratios to measure semi-metric behavior. We compute these ratios for several DN such as digital libraries and web sites and show that they are useful to identify implicit associations. Regarding (2), we describe an algorithm to combine evidence from distance graphs that uses Evidence Sets, a set structure based on Interval Valued Fuzzy Sets and Dempster-Shafer Theory of Evidence. This algorithm has been developed for a recommendation system named TalkMine.

研究动机与目标

  • 通过超链接、引用和关键词派生的距离函数,对文档网络中的关联关系进行建模。
  • 使用定量比率表征现实世界文档网络中半度量行为的程度。
  • 提出一种方法,用于整合来自不同数据源的多个距离图所产生的证据。
  • 通过使用正式的证据融合框架融合多源关联数据,提升推荐系统性能。
  • 在名为TalkMine的原型系统中实现并评估该方法。

提出的方法

  • 定义半度量距离图,其中文档之间的距离反映关联强度,即使不严格满足三角不等式。
  • 引入基于比率的度量方法,量化观测到的距离图中半度量行为的程度。
  • 使用区间值模糊集表示来自不同距离图的不确定性证据,以建模信任区间。
  • 应用Dempster-Shafer证据理论,将多个距离图的信任结构融合为统一的推荐得分。
  • 设计TalkMine推荐系统,利用融合后的证据提供个性化推荐。
  • 使用来自数字图书馆和网站的真实世界数据集,验证半度量行为及证据融合方法的有效性。

实验结果

研究问题

  • RQ1现实世界文档网络在距离关系中在多大程度上表现出半度量行为?
  • RQ2如何定量测量半度量行为的程度,并利用其识别有意义的关联?
  • RQ3如何有效整合来自多个具有不同可靠性与结构的距离图的证据?
  • RQ4与单源方法相比,多源距离证据的融合在多大程度上提升了推荐质量?
  • RQ5正式的信任组合框架能否有效整合文档网络中异构的关联数据?

主要发现

  • 本文证明,数字图书馆和网站等文档网络表现出显著的半度量行为,其可测量比率表明对度量性质的部分遵循。
  • 基于比率的度量方法成功识别出在传统度量可能失效的网络中具有意义的隐含关联。
  • 所提出的基于区间值模糊集与Dempster-Shafer证据理论的证据融合算法,能够稳健融合多源距离数据。
  • 基于该框架构建的TalkMine系统,通过整合多样化的关联信号,实现了更优的推荐质量。
  • 在多个文档网络上的实证评估证实,半度量行为作为关联发现的信号具有实际效用。
  • 异构来源证据的整合,相比单源方法,能带来更准确、更可靠的推荐结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。