[论文解读] Decentralized Multi-Task Learning Based on Extreme Learning Machines
该论文提出了一种基于极限学习机(ELM)的去中心化多任务学习框架,采用混合雅可比与高斯-赛德尔交替方向乘子法(ADMM)算法(DMTL-ELM),在分布式节点间联合优化共享特征权重与任务特定输出权重。通过一种一阶近似变体(FO-DMTL-ELM),该方法在地理分布环境中实现了较低的通信开销,同时保持了具有竞争力的泛化性能,展示了在准确率与通信成本之间可调节的权衡。
In multi-task learning (MTL), related tasks learn jointly to improve generalization performance. To exploit the high learning speed of extreme learning machines (ELMs), we apply the ELM framework to the MTL problem, where the output weights of ELMs for all the tasks are learned collaboratively. We first present the ELM based MTL problem in the centralized setting, which is solved by the proposed MTL-ELM algorithm. Due to the fact that many data sets of different tasks are geo-distributed, decentralized machine learning is studied. We formulate the decentralized MTL problem based on ELM as majorized multi-block optimization with coupled bi-convex objective functions. To solve the problem, we propose the DMTL-ELM algorithm, which is a hybrid Jacobian and Gauss-Seidel Proximal multi-block alternating direction method of multipliers (ADMM). Further, to reduce the computation load of DMTL-ELM, DMTL-ELM with first-order approximation (FO-DMTL-ELM) is presented. Theoretical analysis shows that the convergence to the stationary point of DMTL-ELM and FO-DMTL-ELM can be guaranteed conditionally. Through simulations, we demonstrate the convergence of proposed MTL-ELM, DMTL-ELM, and FO-DMTL-ELM algorithms, and also show that they can outperform existing MTL methods. Moreover, by adjusting the dimension of hidden feature space, there exists a trade-off between communication load and learning accuracy for DMTL-ELM.
研究动机与目标
- 解决在集中式数据收集不可行的地理分布数据环境中,高效训练多任务模型的挑战。
- 在多任务设置中利用极限学习机(ELM)的高速学习能力,提升相关任务之间的泛化性能。
- 设计一种去中心化的优化算法,实现在无中心协调的情况下协同学习共享特征与任务特定权重。
- 在保持高模型准确率的同时,降低分布式多任务学习中的计算与通信开销。
- 在特定条件下,为所提出的去中心化算法建立理论收敛性保证。
提出的方法
- 将多任务ELM问题建模为具有耦合双凸目标的主化多块优化问题,以支持去中心化学习。
- 提出DMTL-ELM,一种结合雅可比与高斯-赛德尔更新的混合ADMM算法,用于求解去中心化优化问题。
- 引入FO-DMTL-ELM,作为DMTL-ELM的一阶近似变体,以降低每轮迭代的计算复杂度。
- 在每个节点使用共享隐藏特征矩阵U和任务特定输出权重向量,通过ADMM对偶变量实现一致性约束。
- 采用交替优化结合近端项的方法,处理非光滑性,并在非凸设置下确保收敛性。
- 应用主化技术近似原始非凸目标,以实现稳定且高效的迭代更新。
实验结果
研究问题
- RQ1基于ELM的去中心化多任务学习框架是否能优于现有的集中式与分布式MTL方法,实现更好的泛化性能?
- RQ2所提出的DMTL-ELM算法的通信负载如何随迭代次数与隐层大小变化?
- RQ3在基于ELM的去中心化MTL框架中,通信成本与学习准确率之间的权衡关系如何?
- RQ4FO-DMTL-ELM中的一阶近似是否在降低计算负载的同时,仍能保持收敛性与泛化性能?
- RQ5在何种条件下,所提出的DMTL-ELM与FO-DMTL-ELM算法可收敛至驻点?
主要发现
- 所提出的MTL-ELM、DMTL-ELM与FO-DMTL-ELM算法在指定条件下均收敛至驻点,且具有理论收敛保证。
- DMTL-ELM的测试误差与集中式MTL-ELM基线相当,证明了其在去中心化协作中的有效性。
- FO-DMTL-ELM相比MTL-ELM与DMTL-ELM显著降低了运行时间,同时保持了具有竞争力的泛化性能。
- 在固定迭代次数(k=25)时,由于收敛不足,DMTL-ELM性能劣于DNSP;但随着k增大及L增加,性能提升。
- 当k=50且L=300时,尽管通信负载更高,DMTL-ELM的泛化性能仍优于DNSP,证实了准确率与通信成本之间的权衡关系。
- DMTL-ELM的通信负载与k×L成正比,通过调节L与k可平衡性能与系统开销。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。