Skip to main content
QUICK REVIEW

[论文解读] UNITER-Based Situated Coreference Resolution with Rich Multimodal Input

Yichen Huang, Yuchen Wang|arXiv (Cornell University)|Dec 7, 2021
Speech and dialogue systems被引用 4
一句话总结

该论文提出了一种基于 UNITER 的模型,用于在 SIMMC 2.0 数据集上进行多模态共指消解,利用包括对话历史、视觉特征、知识库条目、物体坐标和场景图在内的丰富输入。该方法在 test-std 集上取得了 73.3% 的物体 F1 分数,在 DSTC10 挑战赛中排名第二,相较于基线模型提升了 40.7 个百分点。

ABSTRACT

We present our work on the multimodal coreference resolution task of the Situated and Interactive Multimodal Conversation 2.0 (SIMMC 2.0) dataset as a part of the tenth Dialog System Technology Challenge (DSTC10). We propose a UNITER-based model utilizing rich multimodal context such as textual dialog history, object knowledge base and visual dialog scenes to determine whether each object in the current scene is mentioned in the current dialog turn. Results show that the proposed approach outperforms the official DSTC10 baseline substantially, with the object F1 score boosted from 36.6% to 77.3% on the development set, demonstrating the effectiveness of the proposed object representations from rich multimodal input. Our model ranks second in the official evaluation on the object coreference resolution task with an F1 score of 73.3% after model ensembling.

研究动机与目标

  • 解决在多模态、情境化对话系统中,跨视觉、语言和知识进行共指消解的挑战。
  • 通过利用结构化的多模态输入,在 DSTC10 多模态共指消解任务中超越 GPT-2 基线模型。
  • 探究多样化多模态特征(如物体坐标、KB 嵌入和场景图)对共指消解性能的影响。
  • 开发一种稳健的端到端框架,将每个物体视为提及的候选对象,每个对象使用一个二分类头进行预测。

提出的方法

  • 该模型使用 UNITER 联合编码多模态输入,包括对话历史、来自预训练 CNN 的视觉特征,以及来自知识库条目的对象特定嵌入。
  • 每个物体通过组合嵌入表示:包括物体索引、来自 Faster R-CNN 或 CLIP 的图像特征、通过 BERT/SBERT 得到的知识库描述,以及物体位置和先前提及状态等辅助特征。
  • 场景图关系通过注意力偏置或关系感知自注意力层整合,以建模物体之间的空间和关系上下文。
  • 模型对每个物体候选对象执行二分类,以预测其是否在当前对话轮次中被指代。
  • 采用五种表现最佳的基于 UNITER 的模型集成方法,以提升泛化能力并增强在测试集上的最终性能。

实验结果

研究问题

  • RQ1在复杂、现实的对话场景中,基于 UNITER 的架构在多模态输入共指消解方面的有效性如何?
  • RQ2丰富的多模态输入(如物体坐标、KB 条目和场景图)在多大程度上提升了共指消解性能?
  • RQ3来自场景图的结构化关系信息能否增强模型对物体之间空间和上下文关系的理解?
  • RQ4与基于序列的基线模型(如 GPT-2)相比,该方法在 F1 分数和鲁棒性方面表现如何?

主要发现

  • 所提出的基于 UNITER 的模型在保留的 test-std 集上取得了 73.3% 的物体 F1 分数,在 DSTC10 挑战赛中排名第二。
  • 在开发集上,该模型将基线 GPT-2 的 F1 分数从 36.6% 提升至 77.3%,显示出显著的性能提升。
  • 仅引入“先前提及”指示特征,F1 分数便从 0.674 提升至 0.728,表明模型对先前提及具有强烈依赖性。
  • 通过 BERT/SBERT 添加物体坐标和 KB 嵌入后,性能进一步提升,最佳单模型在 dev-test 上达到 0.674 的 F1 分数。
  • 场景图的整合仅带来微小增益,可能是因为提供的图中关系信息有限。
  • 错误分析显示,检测墙上的物体或杂乱场景中的物体仍具挑战性,尤其是当物体较小或被遮挡时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。