[论文解读] STARSS23: An Audio-Visual Dataset of Spatial Recordings of Real Scenes with Spatiotemporal Annotations of Sound Events
本文介绍了STARSS23,这是一个新型的现实世界音视频数据集,包含多通道音频、同步视频以及声音事件的时空标注。该研究提出了一项音视频声音事件定位与检测(SELD)任务,利用视觉物体位置来提升到达方向(DOA)估计性能,通过动作捕捉系统获取的人工确认DOA标签,相较于仅使用音频的基线模型,实现了显著的性能提升。
While direction of arrival (DOA) of sound events is generally estimated from multichannel audio data recorded in a microphone array, sound events usually derive from visually perceptible source objects, e.g., sounds of footsteps come from the feet of a walker. This paper proposes an audio-visual sound event localization and detection (SELD) task, which uses multichannel audio and video information to estimate the temporal activation and DOA of target sound events. Audio-visual SELD systems can detect and localize sound events using signals from a microphone array and audio-visual correspondence. We also introduce an audio-visual dataset, Sony-TAu Realistic Spatial Soundscapes 2023 (STARSS23), which consists of multichannel audio data recorded with a microphone array, video data, and spatiotemporal annotation of sound events. Sound scenes in STARSS23 are recorded with instructions, which guide recording participants to ensure adequate activity and occurrences of sound events. STARSS23 also serves human-annotated temporal activation labels and human-confirmed DOA labels, which are based on tracking results of a motion capture system. Our benchmark results demonstrate the benefits of using visual object positions in audio-visual SELD tasks. The data is available at https://zenodo.org/record/7880637.
研究动机与目标
- 解决当前缺乏真实世界、多模态音视频声音事件定位与检测(SELD)数据集的问题,尤其在精确的空间与时间标注方面。
- 探究视觉模态在复杂自然声音场景中提升到达方向(DOA)估计准确性的能力。
- 提供一个基于动作捕捉系统生成的人工确认DOA标签的基准数据集,用于可靠评估音视频SELD系统。
- 支持基于真实、重叠且动态的声音事件的音视频对应性、声源分离与跨模态学习研究。
提出的方法
- 在16间真实房间中,使用麦克风阵列采集多通道音频,并通过360°摄像头同步录制视频,共涉及57名参与者。
- 在指导性指令下录制声音场景,以确保涵盖多样化、自然且重叠的声音事件,如脚步声、说话声和吸尘器声。
- 利用动作捕捉系统追踪声源的物理位置,并为每个声音事件生成真实DOA标签。
- 由人工评估者对每一帧进行标注,包括目标声音类别的时间激活状态与DOA,确保标注质量。
- 通过在音频和视频输入上训练模型,预测时空声音事件活动与DOA,构建音视频SELD基准。
- 通过Zenodo以MIT许可证发布数据集,DOI为10.5281/zenodo.7709051,实现公开访问与可扩展性。
实验结果
研究问题
- RQ1音视频信息的融合在真实世界音视频场景中,如何提升声音事件定位与检测的准确性?
- RQ2视觉物体位置在多源重叠或瞬态声音事件中,能在多大程度上减少DOA估计的歧义?
- RQ3在具有移动声源的复杂动态环境中,基于STARSS23训练的音视频模型是否能超越仅使用音频的模型?
- RQ4基于动作捕捉系统获取的人工确认DOA标签在真实世界声音场景中是否足够可靠?
- RQ5与仅使用音频的基线模型相比,音视频融合在真实非合成数据上的SELD任务中带来了多大的性能提升?
主要发现
- 使用STARSS23的音视频SELD系统相比仅使用音频的模型,实现了显著更高的定位准确性,证明了视觉模态在减少空间歧义方面的价值。
- 该数据集包含超过7小时的真实世界录音,涵盖57名参与者在16间房间中的活动,真实捕捉了声音事件的时间动态与空间运动特性。
- DOA标签基于动作捕捉系统追踪结果,并经人工评估者确认,确保了高可靠性与对物理声源位置的高度保真度。
- 基准测试结果表明,视觉线索显著提升了检测与定位性能,尤其在脚步声或敲击声等瞬态或重叠事件中表现突出。
- STARSS23支持多种任务,包括音视频SELD、说话人DOA估计、声源定位以及跨模态检索。
- 该数据集以MIT许可证在Zenodo上公开发布,DOI为10.5281/zenodo.7709051,支持可复现研究与社区贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。