Skip to main content
QUICK REVIEW

[论文解读] Expectile Matrix Factorization for Skewed Data Analysis

Rui Zhu, Di Niu|arXiv (Cornell University)|Jun 7, 2016
Sparse and Compressive Sensing Techniques被引用 5
一句话总结

本文提出期望值矩阵分解(EMF),一种鲁棒的矩阵分解方法,通过使用非对称最小二乘法替代最小二乘法来建模偏态数据,通过估计条件期望值而非均值。EMF通过调节期望值水平 ω,在偏态真实世界数据(如网络服务延迟)上的恢复精度得到提升,优于标准矩阵分解,尤其当 ω=0.1 时,可实现类似中位数的中心趋势估计。

ABSTRACT

Matrix factorization is a popular approach to solving matrix estimation problems based on partial observations. Existing matrix factorization is based on least squares and aims to yield a low-rank matrix to interpret the conditional sample means given the observations. However, in many real applications with skewed and extreme data, least squares cannot explain their central tendency or tail distributions, yielding undesired estimates. In this paper, we propose \emph{expectile matrix factorization} by introducing asymmetric least squares, a key concept in expectile regression analysis, into the matrix factorization framework. We propose an efficient algorithm to solve the new problem based on alternating minimization and quadratic programming. We prove that our algorithm converges to a global optimum and exactly recovers the true underlying low-rank matrices when noise is zero. For synthetic data with skewed noise and a real-world dataset containing web service response times, the proposed scheme achieves lower recovery errors than the existing matrix factorization method based on least squares in a wide range of settings.

研究动机与目标

  • 为解决传统矩阵分解在处理真实世界应用中常见的偏态和重尾数据(如网络延迟和用户行为)时的局限性。
  • 开发一种矩阵分解框架,通过估计条件期望值而非条件均值,实现对中心趋势和尾部分布的更好建模。
  • 提供一种基于最小二乘法的鲁棒替代方案,减少异常值和极端值带来的偏差。
  • 通过调节期望值水平 ω ∈ (0,1),实现对数据分布不同部分的灵活建模,支持特定应用场景的需求。
  • 从理论和实证两方面验证所提方法在合成数据和真实世界偏态数据集上的收敛性及更优的恢复性能。

提出的方法

  • 引入一种源自期望值回归的非对称最小二乘损失函数,根据期望值水平 ω 对正负残差分配不同的惩罚。
  • 提出一种交替最小化算法以求解非凸的EMF问题,每个子问题通过二次规划高效求解。
  • 实施两步更新策略:在保持低秩结构的前提下,交替优化用户和物品因子矩阵。
  • 理论上证明在无噪声情况下可全局收敛至真实低秩矩阵,确保在理想条件下实现精确恢复。
  • 通过调节期望值水平 ω 控制对低估和高估的敏感度,实现对数据分布不同分位数的建模。
  • 通过在观测条目上最小化非对称损失,将该方法应用于矩阵补全任务,目标是将未观测条目标记为条件期望值。

实验结果

研究问题

  • RQ1与基于标准最小二乘法的矩阵分解相比,期望值矩阵分解是否能提升在偏态数据上的矩阵恢复性能?
  • RQ2期望值水平 ω 的选择如何影响不同数据分布区域的矩阵恢复精度?
  • RQ3EMF 是否相比传统矩阵分解展现出对异常值和重尾噪声更强的鲁棒性?
  • RQ4通过选择 ω < 0.5,EMF 是否能有效建模偏态数据的中心趋势(如中位数)?
  • RQ5所提出的EMF交替最小化算法在无噪声设定下是否保证收敛至全局最优解?

主要发现

  • 在真实世界网络服务延迟数据上,EMF-0.1 在整体恢复误差上最低,优于标准矩阵分解(ω=0.5)及其他期望值水平。
  • 在低延迟区间(0–0.3秒),EMF-0.1 在相对误差的中位数和四分位距(IQR)方面表现最佳,证实其在建模中心趋势方面的有效性。
  • 在高延迟区间(3.1–20秒),EMF-0.9 表现最佳,表明较高 ω 值在尾部分布估计中更具准确性。
  • 在具有偏态噪声的合成实验中,EMF-0.1 在广泛设置下均显著低于基于MSE的矩阵分解的恢复误差。
  • 所提出的交替最小化算法在无噪声情况下收敛至全局最优解,证明了在理想条件下具备理论收敛性。
  • 真实网络延迟数据上,标准矩阵分解的残差直方图仍高度偏态,表明基于均值的估计存在偏差,难以准确建模中心趋势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。