QUICK REVIEW
[论文解读] Distributed Stochastic Multi-Task Learning with Graph Regularization
Weiran Wang, Jialei Wang|arXiv (Cornell University)|Feb 11, 2018
Stochastic Gradient Optimization Techniques参考文献 6被引用 16
一句话总结
该论文提出了一种分布式随机多任务学习算法,通过图正则化学习,使机器能够学习到既相异又相关的预测器,方法是通过倾斜平均权重或控制一致性方法中的步长。与ADMM和SDCA相比,该方法实现了更快的收敛速度和更低的计算成本,在具有聚类任务结构的合成数据上,批量和随机设置下的实验结果均表现出更优的性能。
ABSTRACT
We propose methods for distributed graph-based multi-task learning that are based on weighted averaging of messages from other machines. Uniform averaging or diminishing stepsize in these methods would yield consensus (single task) learning. We show how simply skewing the averaging weights or controlling the stepsize allows learning different, but related, tasks on the different machines.
研究动机与目标
- 解决每个机器观察到不同数据分布的分布式多任务学习问题,要求学习个性化预测器的同时利用任务相关性。
- 设计仅依赖本地计算和邻居通信的通信高效算法,避免在所有机器间达成共识。
- 为批量和随机变体提供关于通信、样本和计算复杂度的严格收敛保证。
- 在合成多任务回归问题上,优于ADMM和SDCA等现有方法,在收敛速度和计算效率方面表现更优。
提出的方法
- 在图正则化框架中,使用来自邻近机器消息的加权平均,以在各机器上学习到既相异又相关的预测器。
- 通过倾斜平均权重或控制一致性学习中的步长,偏离单任务学习,实现多任务适应。
- 采用批量和随机优化,结合本地梯度或近端更新,并引入基于图的正则化。
- 应用10个最近邻相似性图,基于参数空间中预测器的接近程度来定义任务相关性。
- 采用带图拉普拉斯正则化的正则化经验风险最小化(RERM)目标,以强制连接任务之间的相似性。
- 采用固定小批量采样的随机更新,以降低每次迭代的计算量,同时保持收敛性。
实验结果
研究问题
- RQ1是否可以设计出一种分布式多任务学习方法,使各机器学习到既相异又相关的预测器,而无需强制达成共识?
- RQ2如何在保持收敛保证的前提下,降低分布式多任务学习中的通信效率和计算成本?
- RQ3在一致性算法中通过倾斜平均权重或控制步长,是否能实现比ADMM和SDCA等现有方法更好的收敛性能?
- RQ4在样本效率和计算效率方面,批量和随机变体的性能如何比较?
- RQ5在异构多任务设置中,基于图的正则化是否能提升泛化能力并降低样本复杂度?
主要发现
- 所提出的批量和随机算法在正则化经验风险最小化问题上,收敛速度持续优于ADMM和SDCA。
- 随机算法在处理更少总样本的情况下,性能与ERM方法相当,表明计算成本更低。
- 在每台机器有10000个新样本的情况下,随机方法达到了与基于ERM方法相当的误差,显示出强大的样本效率。
- BOL和SOL变体(优化损失)的误差低于BSR和SSR(求解正则化项),表明基于损失的优化更有效。
- 即使在高任务异质性(C=50个聚类)下,该方法仍保持快速收敛,显示出对不同任务相似度程度的鲁棒性。
- 实验结果表明,基于图的正则化显著提升了泛化能力,尤其在任务聚类时效果更明显。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。