Skip to main content
QUICK REVIEW

[论文解读] Nonconvex One-bit Single-label Multi-label Learning

Shuang Qiu, Tingjin Luo|arXiv (Cornell University)|Mar 17, 2017
Sparse and Compressive Sensing Techniques参考文献 20被引用 3
一句话总结

本文提出了一种非凸交替幂迭代算法,用于一比特单标签多标签学习,将其建模为具有异质感知向量和符号函数链接函数的秩一矩阵感知问题。该方法实现了线性收敛,并在 $ O(k^{1.5}d_1d_2/\epsilon) $ 的采样复杂度下达到近似最优的恢复误差 $ O(\epsilon) $,显著提升了极端低标签场景下的采样效率。

ABSTRACT

We study an extreme scenario in multi-label learning where each training instance is endowed with a single one-bit label out of multiple labels. We formulate this problem as a non-trivial special case of one-bit rank-one matrix sensing and develop an efficient non-convex algorithm based on alternating power iteration. The proposed algorithm is able to recover the underlying low-rank matrix model with linear convergence. For a rank-$k$ model with $d_1$ features and $d_2$ classes, the proposed algorithm achieves $O(ε)$ recovery error after retrieving $O(k^{1.5}d_1 d_2/ε)$ one-bit labels within $O(kd)$ memory. Our bound is nearly optimal in the order of $O(1/ε)$. This significantly improves the state-of-the-art sampling complexity of one-bit multi-label learning. We perform experiments to verify our theory and evaluate the performance of the proposed algorithm.

研究动机与目标

  • 解决在每个样本仅标注一个来自多个可能类别的二值标签时,学习低秩多标签模型的挑战。
  • 在极端标签稀缺条件下,为一比特多标签学习开发一种可证明高效的算法,即每个样本仅观察到一个标签。
  • 通过处理异质感知向量和非光滑符号函数链接函数,克服现有凸方法或对称感知方法的局限性。
  • 在高维设置下,实现近似最优采样复杂度和线性收敛,以恢复底层的低秩权重矩阵。
  • 通过在含噪声和全观测设置下的合成数据实验,验证理论保证。

提出的方法

  • 将单标签多标签学习问题建模为具有非凸一比特秩一矩阵感知的非凸问题,其中感知向量为非对称结构:左向量为 i.i.d. 高斯分布,右向量为独热采样。
  • 提出一种交替幂迭代算法以估计低秩因子矩阵,避免凸松弛,实现高效计算。
  • 利用带噪声的幂迭代构造估计序列,即使在非凸性和非光滑链接函数下也能实现收敛性分析。
  • 直接将符号函数(汉明)损失引入模型,避免先前工作中使用的代理损失。
  • 通过 $ O(kd) $ 的空间复杂度(其中 $ d = d_1 + d_2 $)确保内存效率,并可扩展至大尺寸的 $ d_1, d_2 $。
  • 基于估计序列和次高斯浓度的理论分析,建立线性收敛性和恢复误差界。

实验结果

研究问题

  • RQ1在具有异质感知向量的一比特单标签多标签学习中,非凸算法能否实现线性收敛?
  • RQ2在观测一比特标签条件下,恢复低秩权重矩阵所需的最优采样复杂度是多少?
  • RQ3与现有方法相比,所提算法在噪声或对抗性标签扰动下的表现如何?
  • RQ4该算法能否扩展至全观测多标签学习设置,并实现相当或更优的性能?
  • RQ5在极端标注稀疏场景下,使用符号函数损失是否能比凸代理损失带来更好的泛化性能?

主要发现

  • 在获取 $ O(k^{1.5}d_1d_2/\epsilon) $ 一比特标签后,所提算法可实现 $ O(\epsilon) $ 的恢复误差,其复杂度在 $ O(1/\epsilon) $ 阶次下接近最优。
  • 该算法实现线性收敛,且仅需 $ O(kd) $ 内存,使其可扩展至高维特征空间和类别空间。
  • 实验结果表明,该算法在所有噪声设置下(包括对抗性噪声和随机扰动)均优于 LEML,在预测误差和 AUC 指标上表现更优。
  • 在合成全观测数据集上,该方法在最大数据集上实现了平均 98.15 的 AUC,优于所有基线方法(包括 LEML、SVM、LRT 和 SMT)。
  • 在不同噪声水平($ \xi = 0.1, 0.2, 0.3 $)和标签稀疏度($ p = 1\%, 2.5\%, 5\% $)下,该算法始终优于 LEML,表现出强鲁棒性。
  • 理论分析证实,尽管存在非凸性和非光滑性,该算法仍能实现全局收敛,克服了先前凸方法或对称感知框架的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。