Skip to main content
QUICK REVIEW

[论文解读] DRIVE: One-bit Distributed Mean Estimation

Shay Vargaftik, Ran Ben Basat|arXiv (Cornell University)|May 18, 2021
Privacy-Preserving Technologies in Data参考文献 59被引用 10
一句话总结

DRIVE 提出了一种新颖的一比特分布式均值估计框架,通过随机旋转实现仅需每个客户端传输 $ d(1+o(1)) $ 位即可达到 $ O(1/n) $ 的归一化均方误差(NMSE),显著优于以往方法。该方法利用共享随机性与高效的基于旋转的压缩技术,实现快速、低复杂度的估计,无需昂贵的编码或表示方案。

ABSTRACT

We consider the problem where $n$ clients transmit $d$-dimensional real-valued vectors using $d(1+o(1))$ bits each, in a manner that allows the receiver to approximately reconstruct their mean. Such compression problems naturally arise in distributed and federated learning. We provide novel mathematical results and derive computationally efficient algorithms that are more accurate than previous compression techniques. We evaluate our methods on a collection of distributed and federated learning tasks, using a variety of datasets, and show a consistent improvement over the state of the art.

研究动机与目标

  • 解决在严格带宽约束下的分布式均值估计问题,即每个客户端仅对 $ d $ 维向量传输 $ d(1+o(1)) $ 位。
  • 改进现有压缩技术(尤其是使用随机量化、可变长度编码或 Kashin 表示的方法),在更低计算成本下实现更高精度。
  • 开发一种方法,在不依赖坐标表示长度的前提下,保持强理论保证(如 $ O(1/n) $ 的 NMSE),同时具备计算高效与易于实现的特点。
  • 弥合联邦学习与分布式学习环境中通信效率至关重要的场景下,理论界限与实际性能之间的差距。

提出的方法

  • 对客户端向量应用均匀或结构化的随机旋转(例如使用 Hadamard 矩阵),使坐标具有可交换性与同分布性。
  • 利用旋转后的坐标通过有偏或无偏压缩估计均值,借助发送方与接收方之间的共享随机性提升估计精度。
  • 在旋转后对每个坐标实施一比特量化策略,每个客户端仅发送每个旋转后坐标的符号。
  • 提出 DRIVE 与 DRIVE+ 两种变体:DRIVE 使用固定随机旋转,而 DRIVE+ 引入自适应旋转与共享随机性以提升性能。
  • 理论分析表明,该方法在仅使用 $ d(1+o(1)) $ 位的情况下,可实现 $ O(1/n) $ 的 NMSE,且与坐标表示长度无关。
  • 该方法避免了如可变长度编码或 Kashin 表示等昂贵操作,支持低延迟、可扩展的部署。

实验结果

研究问题

  • RQ1一比特分布式均值估计能否仅使用每个客户端 $ d(1+o(1)) $ 位即实现 $ O(1/n) $ 的归一化均方误差(NMSE)?
  • RQ2发送方与接收方之间的共享随机性如何提升一比特压缩方案中的估计精度?
  • RQ3基于随机旋转的压缩方法能否在理论与实践中均优于现有方法(如带熵编码的随机量化或 Kashin 表示)?
  • RQ4结构化随机旋转与均匀随机旋转对估计精度与计算效率有何影响?
  • RQ5在真实世界分布式学习任务中,DRIVE 的性能如何随客户端数量增加而扩展?

主要发现

  • DRIVE 仅使用每个客户端 $ d(1+o(1)) $ 位即实现了 $ O(1/n) $ 的 NMSE 边界,显著优于以往需要更多比特或更高计算成本的方法。
  • 在 $ n=100 $ 个客户端的分布式 K-Means 与 Power Iteration 任务中,DRIVE 与 DRIVE+ 的 L2 误差低于所有其他低带宽方法,且接近未压缩基线。
  • 对于 $ n=10 $ 个客户端与 Lognormal(0,1) 向量,DRIVE 在每个坐标仅使用一比特时实现经验 NMSE 为 0.0591,而熵编码的随机量化至少需要 1.261 比特每坐标才能达到相同精度。
  • DRIVE 优于最先进的方法,如使用 Huffman 编码的随机量化及其增强变体,即使后者使用超过一比特每坐标。
  • 理论分析表明,在共享随机性假设下,DRIVE 与 DRIVE+ 在渐近意义上为最优,有偏与无偏算法的下界分别为 $ rac{1}{16} $ 与 $ rac{1}{15} $,且使用 $ O(d) $ 个共享随机比特。
  • 在多个数据集与任务上的评估确认了持续的性能提升,尤其在客户端数量增加时,由于估计方差降低而表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。