[论文解读] Federated Learning for Keyword Spotting
该论文提出了一种基于Adam启发的自适应平均方法的联邦学习方法,用于在去中心化的、由用户生成的语音数据上训练轻量级唤醒词检测器,在仅100轮通信中实现5 FAH下95%的召回率,每位用户仅需8 MB上行通信量,显著缩短了训练时间并保护了用户隐私。
We propose a practical approach based on federated learning to solve out-of-domain issues with continuously running embedded speech-based models such as wake word detectors. We conduct an extensive empirical study of the federated averaging algorithm for the "Hey Snips" wake word based on a crowdsourced dataset that mimics a federation of wake word users. We empirically demonstrate that using an adaptive averaging strategy inspired from Adam in place of standard weighted model averaging highly reduces the number of communication rounds required to reach our target performance. The associated upstream communication costs per user are estimated at 8 MB, which is a reasonable in the context of smart home voice assistants. Additionally, the dataset used for these experiments is being open sourced with the aim of fostering further transparent research in the application of federated learning to speech data.
研究动机与目标
- 为解决因说话人和录音差异导致的嵌入式唤醒词检测器在分布外数据上的性能问题。
- 在不集中化原始音频的前提下,实现基于去中心化、用户拥有的语音数据的唤醒词检测器训练,保护用户隐私。
- 降低语音应用中联邦学习的通信成本与收敛时间。
- 展示在非独立同分布(non-iid)的语音联邦学习中,基于Adam的自适应每参数平均方法相较于标准FedAvg的有效性。
提出的方法
- 作者采用联邦平均框架,本地模型在用户设备上使用包含200万个参数和20 MFLOPS计算约束的中等规模神经网络进行训练。
- 将标准全局模型平均替换为受Adam优化器启发的自适应每参数平均规则,通过使用每坐标的自适应学习率来提升收敛性能。
- 系统采用集中式参数服务器,每轮通信后聚合客户端更新,客户端以随机方式选择(10%参与率)以减轻负载。
- 本地训练使用固定的本地学习率0.01,本地训练轮数(E)和批量大小(B)经过调优以平衡收敛速度与通信效率。
- 数据集通过众包方式收集并公开发布,以支持联邦语音学习领域的可复现研究。
- 模型评估在开发集和测试集上进行,评估指标包括召回率和每小时误报率(FAH)。

实验结果
研究问题
- RQ1与标准FedAvg相比,基于Adam的自适应平均是否能提升联邦关键词检测中的收敛速度?
- RQ2在采用自适应平均和现实用户参与率的情况下,唤醒词检测器的联邦训练通信成本是多少?
- RQ3在非独立同分布的联邦设置中,模型性能在不同数据分布和用户特定语音特征下如何变化?
- RQ4本地训练深度(轮数和批量大小)在该设置中对收敛性和通信效率的影响有多大?
- RQ5隐私保护的联邦学习方法在真实语音检测任务中能否实现高召回率和低误报率?
主要发现
- 采用Adam启发的自适应平均将达到95%召回率(5 FAH)所需的通信轮数从标准FedAvg的400多轮减少至仅100轮。
- 最佳模型在负样本测试集上实现3.2 FAH,Librispeech数据集上为3.9 FAH,内部新闻和电视数据集上为0.2–0.6 FAH。
- 当训练在100轮内收敛时,每位用户的上行通信成本估计为8 MB;若训练延长至400轮,则为32 MB。
- 最优配置采用E=1轮本地训练和B=20批量大小,与FedSGD在相似收敛性能下相比,实现了80%的速度提升。
- 标准全局平均(学习率1.0)在400轮后仅实现67.3%的召回率,而自适应平均(η_global=0.001)在相同轮数下达到98.29%的召回率。
- 研究发现,增加本地训练步数对收敛速度影响有限,而本地和全局学习率的调优对性能至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。