[论文解读] SIMMC: Situated Interactive Multi-Modal Conversational Data Collection And Evaluation Platform
SIMMC 引入了一种基于虚拟现实(VR)的平台,利用 AI Habitat 和 Unity 环境,用于收集和评估情境化、多模态对话数据。该平台支持在逼真场景中实时进行用户与助手的交互式数据收集,具备多模态上下文追踪、指代消解和主动对话系统功能,旨在向研究社区发布大规模、逼真的对话人工智能数据集。
As digital virtual assistants become ubiquitous, it becomes increasingly important to understand the situated behaviour of users as they interact with these assistants. To this end, we introduce SIMMC, an extension to ParlAI for multi-modal conversational data collection and system evaluation. SIMMC simulates an immersive setup, where crowd workers are able to interact with environments constructed in AI Habitat or Unity while engaging in a conversation. The assistant in SIMMC can be a crowd worker or Artificial Intelligent (AI) agent. This enables both (i) a multi-player / Wizard of Oz setting for data collection, or (ii) a single player mode for model / system evaluation. We plan to open-source a situated conversational data-set collected on this platform for the Conversational AI research community.
研究动机与目标
- 为填补真实情境化对话人工智能数据的空白,通过模拟沉浸式、交互式环境,使用户与助手在实时交互中共同参与。
- 实现在动态、多模态环境中进行数据收集,视觉、空间和语言信号同时出现,反映真实世界中虚拟助手的交互行为。
- 支持人工在环(Wizard of Oz)数据收集与基于 ParlAI 的自动化系统评估。
- 通过在 VR 中控制数百个对象,生成多样化、可扩展的场景,以增强对话的多样性与真实性。
- 通过丰富的、已记录的交互轨迹,促进多模态指代消解、上下文追踪、知识对齐和对话策略的研究。
提出的方法
- 整合 AI Habitat 和 Unity 作为 VR 引擎,渲染逼真的三维场景,并通过 WebGL 流式传输至用户和助手界面。
- 使用 ParlAI 服务器管理会话配对、路由对话消息,并在用户与助手之间实时同步场景。
- 在每次消息交互时捕获并记录所有用户交互、对话回合、视觉对象状态和场景截图,以支持多模态上下文重建。
- 支持双人制(Wizard of Oz)和单人制(AI 代理评估)两种模式,实现灵活的数据收集与模型基准测试。
- 为巫师提供图形用户界面(GUI)控制,可依据用户话语实时调整场景状态(如对象位置、属性),模拟实时助手行为。
- 利用 AI Habitat 的远程渲染与 Unity 的本地 WebGL 执行,通过场景服务器实现事件同步,确保场景一致性。
实验结果
研究问题
- RQ1如何在沉浸式、交互式 VR 环境中收集真实反映现实情境用户行为的多模态对话数据?
- RQ2在 VR 中动态的人机交互过程中,如何保持视觉、空间和语言等多模态上下文的一致性?
- RQ3如何设计一个可扩展的平台,以支持复杂交互场景中对话人工智能代理的数据收集与评估?
- RQ4使用基于 VR 的仿真,可以有效建模和收集哪些类型的主动与交互式对话场景?
- RQ5对象操作与空间意识的整合如何提升对话人工智能训练数据的真实感与实用性?
主要发现
- SIMMC 通过在逼真 VR 环境中采用双用户巫师式设置,成功实现了实时、沉浸式、多模态对话数据的收集。
- 该平台支持同步记录对话、视觉场景状态、物体布局和截图,为训练与评估提供丰富的多模态上下文信息。
- 通过结合 AI Habitat 和 Unity,系统可支持数百个可控制对象和动态场景配置,显著提升了与传统基于视频的数据集相比的场景多样性。
- 该架构支持人工巫师参与的数据收集与 AI 代理的评估,适用于迭代式系统开发。
- 通过捕获细粒度、时间对齐的交互轨迹,该平台促进了多模态指代消解、上下文追踪和主动对话的研究。
- 作者计划通过 SIMMC 发布一个大规模、情境化的对话数据集,以推动真实、多模态对话人工智能研究的发展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。