Skip to main content
QUICK REVIEW

[论文解读] On the Complexity of Mining Itemsets from the Crowd Using Taxonomies

Antoine Amarilli, Yael Amsterdamer|arXiv (Cornell University)|Dec 11, 2013
Data Mining Algorithms and Applications参考文献 38被引用 13
一句话总结

本文研究了在分类法引导下,利用众包从人类知识中挖掘频繁项集的复杂度。它提出了一个理论框架,同时衡量众包复杂度(向众包提问的次数)和计算复杂度(选择查询所需的努力),并提供了紧致的界限以及高效算法,通过利用分类法的结构来减少查询开销。

ABSTRACT

We study the problem of frequent itemset mining in domains where data is not recorded in a conventional database but only exists in human knowledge. We provide examples of such scenarios, and present a crowdsourcing model for them. The model uses the crowd as an oracle to find out whether an itemset is frequent or not, and relies on a known taxonomy of the item domain to guide the search for frequent itemsets. In the spirit of data mining with oracles, we analyze the complexity of this problem in terms of (i) crowd complexity, that measures the number of crowd questions required to identify the frequent itemsets; and (ii) computational complexity, that measures the computational effort required to choose the questions. We provide lower and upper complexity bounds in terms of the size and structure of the input taxonomy, as well as the size of a concise description of the output itemsets. We also provide constructive algorithms that achieve the upper bounds, and consider more efficient variants for practical situations.

研究动机与目标

  • 将从人类记忆数据中挖掘频繁项集的问题形式化,其中不存在结构化的数据库。
  • 将众包建模为一个预言机,回答关于项集频率的查询,以最小化此类查询的数量。
  • 分析众包复杂度(查询次数)与计算复杂度(选择查询所需的努力)之间的权衡。
  • 利用语义分类法(例如“是-一种”层次结构)来减少冗余查询,并利用相关项集之间的频率传播。
  • 在分类法下建立识别所有频繁项集的复杂度的紧致理论界限,并提供实现这些界限的构造性算法。

提出的方法

  • 使用分类法(部分“是-一种”层次结构)对项的领域进行建模,以表示项之间的语义关系。
  • 在项集上定义频率谓词,并利用若一个项集是频繁的,则其在分类法中的超集也是频繁的(由于继承性)这一事实。
  • 使用最小频繁项集(MFIs)和最大不频繁项集(MIIs)作为核心结构组件,以限制查询次数。
  • 设计交互式、自适应的算法,根据先前的回答动态选择查询,从而减少总的众包交互次数。
  • 应用超图遍历和对偶性技术来分析复杂度,特别是与EQ问题(枚举极值集)的关系。
  • 提供构造性算法,实现众包复杂度的上界,并针对实际部署进行优化。

实验结果

研究问题

  • RQ1在使用分类法引导搜索时,识别所有频繁项集所需的最少众包查询次数是多少?
  • RQ2分类法的结构(例如深度、分支因子)如何影响众包和计算复杂度?
  • RQ3通过利用分类法中的语义关系,能否实现最优或近似最优的查询复杂度?
  • RQ4查询数量与选择查询所需计算努力之间的权衡是什么?
  • RQ5当施加约束条件时(如限制项集大小或聚焦于特定的分类法片段),复杂度界限如何变化?

主要发现

  • 众包复杂度的下界为 Ω(log |S(Ψ)|),其中 |S(Ψ)| 是由分类法诱导的所有可能项集的集合大小。
  • 众包复杂度的下界也由 Ω(|MFI| + |MII|) 给出,其中 |MFI| 和 |MII| 分别是最大频繁项集和最大不频繁项集集合的大小。
  • 众包复杂度的上界为 O(log |S(Ψ)|),该上界是紧致的,并可通过利用分类法结构的构造性算法实现。
  • 计算复杂度的上界由计算 MFI 和 MII 集所需的时间决定,且存在高效算法可达到该上界。
  • 使用分类法可通过在层次结构中传播频率信息,显著减少查询次数,避免冗余查询。
  • 该问题被证明是EQ-hard的,与超图中枚举极值集这一基本问题相关联,该问题在一般情况下仍为开放问题,但在分类法约束下是可解的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。