Skip to main content
QUICK REVIEW

[论文解读] LayoutGMN: Neural Graph Matching for Structural Layout Similarity

Akshay Gadi Patil, Manyi Li|arXiv (Cornell University)|Dec 11, 2020
Advanced Image and Video Retrieval Techniques参考文献 46被引用 4
一句话总结

LayoutGMN 是一种深度神经网络,通过在三元组网络设置中使用基于注意力的图匹配来学习结构化布局相似性,利用基于 IoU 的弱监督训练具有内置结构偏差的模型。其在检索准确率上优于 IoU 和最先进基线模型,在平面图和用户界面设计的结构相似性判断上更符合人类判断。

ABSTRACT

We present a deep neural network to predict structural similarity between 2D layouts by leveraging Graph Matching Networks (GMN). Our network, coined LayoutGMN, learns the layout metric via neural graph matching, using an attention-based GMN designed under a triplet network setting. To train our network, we utilize weak labels obtained by pixel-wise Intersection-over-Union (IoUs) to define the triplet loss. Importantly, LayoutGMN is built with a structural bias which can effectively compensate for the lack of structure awareness in IoUs. We demonstrate this on two prominent forms of layouts, viz., floorplans and UI designs, via retrieval experiments on large-scale datasets. In particular, retrieval results by our network better match human judgement of structural layout similarity compared to both IoUs and other baselines including a state-of-the-art method based on graph neural networks and image convolution. In addition, LayoutGMN is the first deep model to offer both metric learning of structural layout similarity and structural matching between layout elements.

研究动机与目标

  • 开发一种深度学习模型,用于衡量二维布局(如平面图和用户界面设计)之间的结构相似性,超越像素级度量。
  • 通过嵌入结构归纳偏差来解决 IoU 在捕捉结构对应关系方面的局限性。
  • 通过注意力机制实现布局相似性的度量学习与元素级结构匹配。
  • 使用 IoU 阈值作为弱监督信号进行模型训练,避免昂贵的人工标注。
  • 展示优于人类判断结构相似性的检索性能。

提出的方法

  • 将每个布局表示为有向完全连接图,节点编码元素语义、位置信息,边表示结构关系。
  • 在三元组损失框架下,采用基于注意力的图匹配网络(GMN)实现跨图消息传递与节点级匹配。
  • 使用基于 IoU 阈值生成的弱标签进行损失计算,实现端到端训练,无需专家标注。
  • 通过注意力机制引入结构归纳偏差,强制在图嵌入学习过程中保持布局元素之间的对应关系。
  • 利用学习到的注意力权重同时实现相似性预测与元素级匹配,支持跨布局的标签迁移。
  • 采用弱监督方式训练模型,以 IoU 作为结构相似性的代理指标,同时模型架构弥补了 IoU 缺乏结构感知能力的不足。

实验结果

研究问题

  • RQ1深度神经网络能否学习一种布局相似性度量,使其比像素级度量(如 IoU)更符合人类对结构相似性的感知?
  • RQ2在无显式结构监督的情况下,基于注意力机制的图匹配网络在多大程度上能学习到布局元素之间的结构对应关系?
  • RQ3通过 IoU 阈值实现的弱监督在多大程度上能有效训练出泛化到结构化布局相似性的模型?
  • RQ4LayoutGMN 中的注意力机制是否可用于在几何失配情况下,将标签从一个布局迁移到另一个布局?
  • RQ5LayoutGMN 在平面图和用户界面设计的布局检索任务中是否优于最先进基于 GNN 和图像的模型?

主要发现

  • 在大规模平面图和用户界面设计数据集上,LayoutGMN 的 Precision@k 分数高于 IoU 和其他基线模型,当保留边信息时,Precision@10 达到 11.3%。
  • 模型的检索结果比 IoU 更符合人类对结构相似性的判断,尤其在 IoU 因布局错位但结构相似而失效的情况下表现更优。
  • 消融实验表明,移除图边、框位置或节点语义信息会显著降低性能,当移除位置编码时,Precision@1 降至 15%。
  • LayoutGMN 成功通过基于注意力的元素匹配,将标签从源布局迁移到目标布局,即使布局之间存在几何失配。
  • 注意力机制实现了鲁棒的元素级对应关系,标签迁移实验表明 LayoutGMN 优于最大像素重叠匹配方法。
  • 模型的结构偏差有效弥补了基于 IoU 的监督信号缺乏结构感知能力的缺陷,使其即使在弱监督下仍能学习到有意义的结构相似性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。