[论文解读] Knowledge-driven Scene Priors for Semantic Audio-Visual Embodied Navigation
该论文通过整合一种新型知识图谱以编码物体-区域和区域-区域关系、双图编码器网络用于空间推理,并在强化学习框架中融合预训练的视觉与音频编码器,提出了一种知识驱动的场景先验方法,用于语义视听具身导航。该方法在未见区域和真正新颖声音物体上的泛化能力显著提升,在Habitat-Matterport3D环境的未见情境下优于强基线模型。
Generalisation to unseen contexts remains a challenge for embodied navigation agents. In the context of semantic audio-visual navigation (SAVi) tasks, the notion of generalisation should include both generalising to unseen indoor visual scenes as well as generalising to unheard sounding objects. However, previous SAVi task definitions do not include evaluation conditions on truly novel sounding objects, resorting instead to evaluating agents on unheard sound clips of known objects; meanwhile, previous SAVi methods do not include explicit mechanisms for incorporating domain knowledge about object and region semantics. These weaknesses limit the development and assessment of models' abilities to generalise their learned experience. In this work, we introduce the use of knowledge-driven scene priors in the semantic audio-visual embodied navigation task: we combine semantic information from our novel knowledge graph that encodes object-region relations, spatial knowledge from dual Graph Encoder Networks, and background knowledge from a series of pre-training tasks -- all within a reinforcement learning framework for audio-visual navigation. We also define a new audio-visual navigation sub-task, where agents are evaluated on novel sounding objects, as opposed to unheard clips of known objects. We show improvements over strong baselines in generalisation to unseen regions and novel sounding objects, within the Habitat-Matterport3D simulation environment, under the SoundSpaces task.
研究动机与目标
- 提升具身智能体在语义视听导航中对未见环境和已知声音之外的泛化能力。
- 解决先前SAVi基准在真正新颖声音物体上的评估缺失问题。
- 将关于物体-区域语义和空间关系的领域知识整合到导航策略中。
- 开发一种模块化、知识增强的框架,以提升样本效率和决策可解释性。
- 定义一项新基准任务,用于评估智能体在新颖声音物体上的表现,而不仅仅是未听过的已知物体音频片段。
提出的方法
- 构建一种新型知识图谱,用于编码室内环境中物体-物体、物体-区域和区域-区域之间的关系。
- 采用双图编码器网络,建模物体与区域之间的空间和语义关系。
- 在精心筛选的多模态数据集上对视觉和音频编码器进行预训练,以增强对物体的感知能力和对声音的理解能力。
- 利用基于记忆的注意力机制,将知识驱动的场景先验集成到强化学习框架中。
- 采用模块化训练范式,以提升跨领域泛化能力,并优化视觉与音频模态的推理过程。
- 应用多流注意力机制(SMT),融合视觉、音频和基于知识的推理,以支持导航决策。
实验结果
研究问题
- RQ1知识驱动的场景先验能否提升语义视听导航中对未见室内环境的泛化能力?
- RQ2在导航中显式引入物体-区域和区域-区域语义关系,是否能提升智能体对新颖声音物体的表现?
- RQ3在精心筛选的视觉数据集上进行预训练,对物体感知能力和导航成功率有何影响?
- RQ4模块化、知识增强的强化学习框架能否在零样本泛化到未见区域和未听过的声响时,超越强基线模型?
- RQ5知识融合在多模态导航中,能在多大程度上提升样本效率和决策可解释性?
主要发现
- 所提出的K-SAVEN模型在未见房屋场景(UH/HS)上的成功率为73.2%,在未见房屋中未听过的声响(UH/US)上的成功率为31.9%,显著优于强基线模型。
- 在UH/HS设置下,仅使用GENV和同时使用GENs的模型分别达到73.2%和73.0%的成功率,显著优于仅使用GENB的64.4%成功率。
- 在UH/US设置下,仅使用GENB的模型达到23.3%的成功率,优于仅使用GENV的21.2%,表明音频推理对新颖声音更为关键。
- 同时具备视觉和音频知识流的完整模型(both-GENs)在SPL和SNA得分上均优于SAVi,表明其路径更短、更高效。
- 定性结果表明,K-SAVEN的轨迹更直接,到达目标更快,步数更少,且路径更少徘徊。
- 消融实验确认,结合视觉与音频推理及知识先验,其泛化能力优于单独使用任一模态。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。