[论文解读] Fast forwarding Egocentric Videos by Listening and Watching
本文提出了一种新颖的方法,通过结合音频中的心理声学烦扰度度量与视觉特征(如不稳定性、外观和运动),实现对第一人称视频的快速播放。该方法在大多数视频中实现了10倍速播放,同时减少了令人不适的音频片段,尽管其不稳定性略高于当前最先进的纯视觉方法。
The remarkable technological advance in well-equipped wearable devices is pushing an increasing production of long first-person videos. However, since most of these videos have long and tedious parts, they are forgotten or never seen. Despite a large number of techniques proposed to fast-forward these videos by highlighting relevant moments, most of them are image based only. Most of these techniques disregard other relevant sensors present in the current devices such as high-definition microphones. In this work, we propose a new approach to fast-forward videos using psychoacoustic metrics extracted from the soundtrack. These metrics can be used to estimate the annoyance of a segment allowing our method to emphasize moments of sound pleasantness. The efficiency of our method is demonstrated through qualitative results and quantitative results as far as of speed-up and instability are concerned.
研究动机与目标
- 解决现有视频快进方法仅依赖视觉特征、忽略可穿戴设备中丰富音频信息的局限性。
- 通过避免如嘈杂人群或高分贝环境等令人不适的音频片段,改善长时第一人称视频的用户体验。
- 开发一种在保持时间连续性的同时,通过多模态(音频-视觉)语义评分实现高速视频摘要的方法。
- 证明心理声学度量可有效指导视频摘要,通过识别并弱化令人烦扰的音频内容。
提出的方法
- 将第一人称视频的音频分割为3秒的片段,以实现对每个片段的心理声学特征的分析。
- 使用响度、尖锐度和粗糙度计算心理声学烦扰度(PA)度量,以估计每个音频片段的感知烦扰程度。
- 提取视觉特征,包括帧不稳定性(通过扩张聚焦计算)、外观(颜色直方图的地球移动距离)和运动(光流幅值)。
- 将PA度量与视觉特征结合,形成线性评分,以分配每个视频片段的语义相关性。
- 利用组合的语义评分指导视频合成,选择用于超时间 lapse 的帧,以保持时间流动并避免高烦扰度片段。
- 对最终视频应用10倍速播放因子,帧选择按语义评分加权,优先保留愉悦且有意义的时刻。
实验结果
研究问题
- RQ1与仅依赖视觉的方法相比,音频中的心理声学度量是否能提升快进播放的第一人称视频质量?
- RQ2将基于声音的烦扰度估计纳入后,对超时间 lapse 视频的感知愉悦度和稳定性有何影响?
- RQ3音频特征在多大程度上能减少快进视频中不愉快音频片段(如嘈杂人群)的包含?
- RQ4与仅依赖视觉的最先进方法相比,所提方法在速度提升、不稳定性及感知质量方面表现如何?
- RQ5多模态(音频-视觉)方法是否能在第一人称视频摘要中实现高速播放与低感知烦扰度之间的平衡?
主要发现
- 所提方法在11个视频片段中的10个实现了10倍速播放,达到或超过MIFF基线的速度提升水平。
- 最终超时间 lapse 的平均心理声学烦扰度(PA)得分为22.2,低于MIFF方法的23.2,表明更少的烦扰音频片段。
- 所提方法的不稳定性指数平均为38.9,略高于MIFF的37.2,表明在音质改善方面存在轻微的时间稳定性权衡。
- 定性结果显示,高PA片段(如嘈杂音乐或人群)显著被弱化,而低PA片段(如安静街道)则被保留并以较低速度播放。
- 该方法通过利用心理声学度量,成功避免了高烦扰度音频内容,如突然的响亮噪音或持续的背景噪音。
- 音频与视觉特征的结合使快进视频更具感知愉悦度,即使在牺牲少量时间稳定性的情况下亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。