Skip to main content
QUICK REVIEW

[论文解读] MAAS: Multi-modal Assignation for Active Speaker Detection

Juan León-Alcázar, Fabian Caba Heilbron|arXiv (Cornell University)|Jan 11, 2021
Speech and Audio Processing参考文献 59被引用 9
一句话总结

MAAS 提出了一种用于主动说话者检测的新型多模态指派框架,将该任务建模为使用图神经网络将多个视觉说话者嵌入与共享音频嵌入进行匹配。通过建模帧级亲和力并利用动态图结构实现时间一致性,MAAS 在 AVA-ActiveSpeaker 上实现了 88.8% 的新 SOTA mAP,并在无需微调的情况下,在一个新挑战性基准 Talkies 上比之前的方法高出 1.7%。

ABSTRACT

Active speaker detection requires a solid integration of multi-modal cues. While individual modalities can approximate a solution, accurate predictions can only be achieved by explicitly fusing the audio and visual features and modeling their temporal progression. Despite its inherent muti-modal nature, current methods still focus on modeling and fusing short-term audiovisual features for individual speakers, often at frame level. In this paper we present a novel approach to active speaker detection that directly addresses the multi-modal nature of the problem, and provides a straightforward strategy where independent visual features from potential speakers in the scene are assigned to a previously detected speech event. Our experiments show that, an small graph data structure built from a single frame, allows to approximate an instantaneous audio-visual assignment problem. Moreover, the temporal extension of this initial graph achieves a new state-of-the-art on the AVA-ActiveSpeaker dataset with a mAP of 88.8\%.

研究动机与目标

  • 解决当前主动说话者检测方法的局限性,这些方法集中于短期、帧级建模,无法有效处理多说话者歧义性和时间不一致性。
  • 将主动说话者检测重新构建成一个多模态指派问题,其中来自多个说话者的视觉特征被匹配到单个共享的音频嵌入。
  • 通过基于图的时间建模,提升对非语音面部动作(例如大笑)和非画面内语音引起的误报的鲁棒性。
  • 引入一个新基准 Talkies,由 10,000 个多样化且具有挑战性的视频片段组成,用于评估模型在现有数据集之外的泛化能力和迁移能力。
  • 证明仅基于局部特征构建的简单图结构,即可近似瞬时的音视频指派问题,同时实现长期的时间一致性。

提出的方法

  • 该方法采用双流图神经网络:一者具有静态的、帧级的连接结构,另一者具有从嵌入空间中最近邻学习得到的动态、基于特征的连接。
  • 构建一个图结构,其中每个节点代表一个面部裁剪区域(视觉特征),每帧包含一个共享的音频节点,边则编码音视频亲和力。
  • 通过图卷积层传播和聚合多模态信息,将与音频节点亲和力最高的视觉节点识别为活跃说话者。
  • 通过在更长的时间窗口上扩展图结构,实现时间一致性,使信息能在时间维度上传播并稳定预测结果。
  • 动态流从特征空间学习自适应图结构,支持说话人之间的连接、跨模态连接以及长距离的音视频连接,突破了固定拓扑结构的限制。
  • 模型在 AVA-ActiveSpeaker 上进行预训练,并在无需微调的情况下在 Talkies 上进行评估,训练期间采用一种增强策略,模拟非画面内语音。

实验结果

研究问题

  • RQ1基于图的多模态指派框架是否能通过直接建模多个说话者之间的音视频对应关系,从而提升主动说话者检测性能?
  • RQ2通过图传播实现的时间一致性,在存在说话人切换的长时动态对话中,对性能有何影响?
  • RQ3在不进行微调的情况下,一个在标准基准上预训练的模型,能在多大程度上泛化到更具挑战性、更丰富的现实世界场景?
  • RQ4动态的、基于特征的图连接在解决如非画面内语音或模仿说话的面部动作等模糊情况中起到何种作用?
  • RQ5在训练期间模拟非画面内语音是否能提升模型对未见的复杂音视频场景的鲁棒性?

主要发现

  • MAAS 在 AVA-ActiveSpeaker 数据集上实现了 88.8% 的新 SOTA mAP,比之前的方法至少高出 1.7%。
  • 在新的 Talkies 基准上,MAAS 比 AVA 基线高出 7.6%,比 SOTA 集成模型高出 1.7%,且无需微调。
  • 在一段包含非画面内语音的具有挑战性的旁白片段中,mAP 从 64% 提升至 97.9%,表明对误报具有极强的鲁棒性。
  • 动态图流能够建立有用的连接模式,包括长距离的音视频连接和跨时间的跨模态弧线,从而增强时间一致性。
  • 一种简单的增强策略——在训练期间随机将静音音频轨道替换为语音——使 Talkies 上的性能提升了 0.6%,表明对未见场景的泛化能力得到改善。
  • 该方法在不同领域间具有良好的泛化能力:在 AVA-ActiveSpeaker 上预训练并在 Talkies 上测试,可实现优异的零样本性能,证实了该方法的鲁棒性与可迁移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。