Skip to main content
QUICK REVIEW

[論文レビュー] LayoutGMN: Neural Graph Matching for Structural Layout Similarity

Akshay Gadi Patil, Manyi Li|arXiv (Cornell University)|Dec 11, 2020
Advanced Image and Video Retrieval Techniques参考文献 46被引用数 4
ひとこと要約

LayoutGMN は、IoU に基づく弱い教師信号を用いて、構造的バイアスを組み込んだトリプルットネットワーク設定下で、アテンションベースのグラフマッチングを用いて構造的レイアウト類似度を学習する深層ニューラルネットワークである。このモデルは、床図やUIデザインにおける人間の構造的類似性判断とより整合性の高い検索精度を達成し、IoU や最先端のベースラインを上回る性能を示す。

ABSTRACT

We present a deep neural network to predict structural similarity between 2D layouts by leveraging Graph Matching Networks (GMN). Our network, coined LayoutGMN, learns the layout metric via neural graph matching, using an attention-based GMN designed under a triplet network setting. To train our network, we utilize weak labels obtained by pixel-wise Intersection-over-Union (IoUs) to define the triplet loss. Importantly, LayoutGMN is built with a structural bias which can effectively compensate for the lack of structure awareness in IoUs. We demonstrate this on two prominent forms of layouts, viz., floorplans and UI designs, via retrieval experiments on large-scale datasets. In particular, retrieval results by our network better match human judgement of structural layout similarity compared to both IoUs and other baselines including a state-of-the-art method based on graph neural networks and image convolution. In addition, LayoutGMN is the first deep model to offer both metric learning of structural layout similarity and structural matching between layout elements.

研究の動機と目的

  • 床図やUIデザインなどの2次元レイアウト間の構造的類似度を、ピクセルレベルの指標を越えて測定する深層学習モデルの開発。
  • IoU が構造的対応を捉えきれないという限界を補うために、モデルに構造的インダクティブバイアスを埋め込むこと。
  • アテンション機構を用いて、レイアウト類似度のメトリック学習と要素レベルの構造的マッチングの両方を可能にすること。
  • 人間のアノテーションに代わる高コストな作業を回避するため、IoU の閾値を用いた弱い教師信号によるモデル学習。
  • 人間の構造的類似性判断と整合性の高い優れた検索性能を実証すること。

提案手法

  • 各レイアウトを、要素の意味、位置を符号化するノードと、構造的関係を表すエッジを持つ、有向かつ完全に接続されたグラフとして表現する。
  • トリプルット損失フレームワーク内でのクロスグラフメッセージパッシングとノードレベルのマッチングを実現する、アテンションベースのグラフマッチングネットワーク(GMN)を採用する。
  • IoU の閾値から導出される弱いラベルを用いて、エキスパートのアノテーションが不要なエンドツーエンド学習を可能にする、トリプルット損失を適用する。
  • グラフ埋め込み学習中にレイアウト要素間の対応を強制するアテンション機構を用いて、構造的インダクティブバイアスを導入する。
  • 学習されたアテンション重みを、類似度予測と要素レベルのマッチングの両方の目的に活用し、レイアウト間でのラベル転送を可能にする。
  • IoU を構造的類似度の代理として弱い教師信号として用いながら、モデルのアーキテクチャが IoU の構造認識の欠如を補うように設計されている。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、IoU などのピクセルベースの指標よりも、人間の構造的類似性認識をよりよく反映するレイアウト類似度メトリックを学習できるか?
  • RQ2明示的な構造的監視がなければ、アテンション機構を備えたグラフマッチングネットワークが、レイアウト要素間の構造的対応をどの程度正しく学習できるか?
  • RQ3IoU の閾値による弱い教師信号は、ピクセルの整合性を超えて構造的レイアウト類似度に一般化可能なモデルを学習するためにどの程度有効か?
  • RQ4LayoutGMN のアテンション機構は、幾何的ずれがある状況でも、1つのレイアウトから別のレイアウトへラベルを転送するために使用できるか?
  • RQ5LayoutGMN は、床図やUIデザインのレイアウト検索タスクにおいて、最先端のGNNベースおよび画像ベースのモデルを上回る性能を示すか?

主な発見

  • レイアウトにエッジを保持した状態で、大規模な床図およびUIデザインデータセットにおいて、LayoutGMN は IoU や他のベースラインよりも高い Precision@k スコアを達成しており、Precision@10 は 11.3% に達する。
  • モデルの検索結果は、IoU よりも人間の構造的類似性判断とより一貫しており、特にレイアウトがずれているが構造的に類似している場合に IoU が失敗する状況で顕著に優れている。
  • アブレーションスタディの結果、グラフエッジ、ボックスの位置、ノードの意味のいずれかを除去すると性能が著しく低下し、位置符号化を除去した場合の Precision@1 は 15% にまで低下する。
  • レイアウトが幾何的に整合していない状況でも、アテンションベースの要素マッチングを用いて、ソースレイアウトからターゲットレイアウトへラベルを効果的に転送できた。
  • アテンション機構により、要素レベルの対応が強く保証されており、最大ピクセル被り重みマッチングを上回る性能を示すラベル転送の実験でその有効性が裏付けられた。
  • モデルの構造的バイアスは、IoU に基づく教師信号の構造認識の欠如を効果的に補っており、弱いラベルにもかかわらず、意味のある構造的類似度を学習可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。