[论文解读] Speaker Diarization as a Fully Online Learning Problem in MiniVox
本文提出了一种完全在线的说话人分割框架,能够在无需预训练或用户注册的情况下实时学习,利用上下文Bandit方法结合半监督与自监督学习,以处理稀疏的、分段式的反馈。该研究引入了MiniVox,一个用于无限在线多说话人流的基准数据集,并展示了在低反馈场景下的鲁棒性能,尤其在MFCC-based学习中反馈概率p=0.01的挑战性设置下,优于基线模型。
We proposed a novel machine learning framework to conduct real-time multi-speaker diarization and recognition without prior registration and pretraining in a fully online learning setting. Our contributions are two-fold. First, we proposed a new benchmark to evaluate the rarely studied fully online speaker diarization problem. We built upon existing datasets of real world utterances to automatically curate MiniVox, an experimental environment which generates infinite configurations of continuous multi-speaker speech stream. Second, we considered the practical problem of online learning with episodically revealed rewards and introduced a solution based on semi-supervised and self-supervised learning methods. Additionally, we provided a workable web-based recognition system which interactively handles the cold start problem of new user's addition by transferring representations of old arms to new ones with an extendable contextual bandit. We demonstrated that our proposed method obtained robust performance in the online MiniVox framework.
研究动机与目标
- 为解决在现实场景中部署说话人分割系统时,预训练和用户注册不可行的实际挑战。
- 将说话人分割建模为一个完全在线学习问题,其中奖励以分段形式揭示,实现对新说话人的持续适应。
- 开发一种系统,能够在冷启动阶段将现有用户的知识迁移至新用户,最大限度减少数据需求。
- 构建一个可扩展的基准MiniVox,用于在多样化、持续的多说话人流式条件下评估在线分割性能。
- 探究自监督与半监督学习在低反馈在线学习设置下对说话人分割的有效性。
提出的方法
- 提出一种基于LinUCB与BerlinUCB的上下文Bandit框架,用于建模说话人分割中的在线决策,其中动作对应于说话人分配。
- 引入半监督学习组件,为未标记的分段分配伪动作,实现在用户未提供反馈时仍能传播奖励信号。
- 在未标记数据上应用自监督聚类(如K-means、GMM、KNN)以生成伪奖励,提升在稀疏反馈场景下的模型更新效率。
- 通过上下文Bandit扩展机制,将现有‘臂’(说话人档案)的表示迁移至新用户,实现冷启动处理。
- 构建MiniVox,一个合成基准,将真实世界数据集转化为无限长、可配置的在线音频流,支持不同说话人数量与反馈概率。
- 采用基于对比损失的嵌入(MFCC、CNN),并在有/无oracle反馈条件下评估性能。
实验结果
研究问题
- RQ1能否在无需预训练或用户注册的情况下,有效将说话人分割建模为完全在线学习问题?
- RQ2半监督与自监督方法在处理在线分割中的稀疏、分段式反馈时,效果如何?
- RQ3在在线设置中,现有说话人档案的知识在冷启动阶段能多大程度上被迁移至新用户?
- RQ4在低反馈概率(如p=0.01)条件下,基于Bandit的在线分割性能与监督基线相比如何?
- RQ5自监督是否能提升低反馈或分布外设置下的性能?在何种条件下效果最佳?
主要发现
- 在MFCC-based的MiniVox基准中,反馈概率p=0.01时,所提出的自监督上下文Bandit方法优于标准BerlinUCB与基线模型,在MiniVox C20-MFCC-60k上达到92.31%的准确率。
- 基于BerlinUCB主干的B-KNN与B-GMM变体表现优异,尤其在高难度设置下,B-GMM在Oracle反馈下于MiniVox C20-MFCC-60k上达到95.19%的准确率。
- 在低反馈场景(p=0.1或p=0.01)下,自监督变体相比标准BerlinUCB性能更优,表明其在稀疏反馈场景中的价值。
- MiniVox基准支持在多样化配置下稳定评估在线分割性能,包括不同说话人数量与反馈概率,展现出良好的可扩展性。
- 尽管Bandit反馈设置本身具有挑战性,所提方法仍实现了鲁棒性能,错误率显著低于在缺乏完整监督情况下的预期水平。
- 结果表明,自监督在具有挑战性的低反馈设置中最为有益,尤其当与Bandit主干的高效奖励映射结合时效果更佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。