Skip to main content
QUICK REVIEW

[论文解读] Learning from networked examples in a k-partite graph

Yuyi Wang, Jan Ramon|arXiv (Cornell University)|Jun 3, 2013
Machine Learning and Data Classification参考文献 8被引用 3
一句话总结

本文提出了一种新颖的加权方法,用于在k重图中从网络化样本中学习,其中由于共享顶点或边,训练样本存在依赖性。通过分配可高效计算的非负权重,并利用伯恩斯坦型不等式,该方法在一般化误差界方面优于独立同分布(i.i.d.)假设或独立子集选择方法,在依赖数据设置下显著改进了样本误差估计。

ABSTRACT

Many machine learning algorithms are based on the assumption that training examples are drawn independently. However, this assumption does not hold anymore when learning from a networked sample where two or more training examples may share common features. We propose an efficient weighting method for learning from networked examples and show the sample error bound which is better than previous work.

研究动机与目标

  • 解决标准机器学习假设中训练样本独立同分布(i.i.d.)在样本具有网络结构时的局限性。
  • 克服从网络化数据集中仅选择独立样本所导致的低效性和次优性。
  • 开发一种计算高效的加权策略,以保留完整数据集中的更多信息。
  • 为应用于网络化样本的经验风险最小化(ERM)算法推导更紧的一般化误差界。
  • 基于统计不等式,为k重超图结构化数据中的依赖性提供理论基础。

提出的方法

  • 使用k重超图 G = (V, E, X, Y, φ) 建模网络化样本,其中顶点被划分为k个集合,超边连接每个划分中的一个顶点。
  • 基于依赖图的分数着色,为每个训练样本(超边)分配非负权重,以最小化权重总和。
  • 使用伯恩斯坦型集中不等式处理加权经验过程,以界定向验风险与期望风险之间的偏差。
  • 应用加权经验风险最小化(WRM)框架,其中加权样本 Z_s 取代标准i.i.d.样本用于学习。
  • 推导出依赖于权重总和(s)和假设空间复杂度的一般化误差界,表明其在样本误差方面优于i.i.d.和独立子集方法。
  • 利用覆盖数和度量熵控制在依赖性存在时假设空间的复杂度。

实验结果

研究问题

  • RQ1当训练样本因网络结构中的共享特征而存在依赖性时,如何改进一般化误差界?
  • RQ2能否设计一种对网络化样本既计算高效又统计有效的加权方案?
  • RQ3在网络化数据上采用加权经验风险最小化方法,是否能获得比将样本视为i.i.d.或选择独立子集更优的样本误差界?
  • RQ4在依赖设置下,可使用何种统计不等式来界定向验风险与期望风险之间的偏差?
  • RQ5最优权重总和(s)如何影响网络化学习中的泛化性能?

主要发现

  • 所提加权方法的一般化误差界形式为 Pr(ℰ_H(f_Z_s) ≥ ε) ≤ 𝒩(ℋ, ε/(12M)) exp(–sε/(300M⁴)),优于基于i.i.i.d.假设推导出的界。
  • 该方法在样本误差界方面优于选择独立样本子集的方法,因为它利用了全部可用数据,而非丢弃可能具有信息量的依赖样本。
  • 权重可通过依赖图的分数色数高效计算,使该方法可扩展至大规模网络。
  • 理论分析表明,权重总和(s)直接影响收敛速率,s越大,界越紧。
  • 分析中使用的伯恩斯坦型不等式考虑了损失的方差和有界性,从而在依赖设置中实现更紧密的控制。
  • 该方法适用于ERM,并可扩展至具有类似理论保证的正则化学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。