Skip to main content
QUICK REVIEW

[論文レビュー] BLT: Bidirectional Layout Transformer for Controllable Layout Generation

Xiang Rong Kong, Lu Jiang|arXiv (Cornell University)|Dec 9, 2021
Handwritten Text Recognition Techniques被引用数 4
ひとこと要約

BLTは、学習時に両方向の属性に注目することで、推論時に低信頼度の属性を繰り返し精錬する非自己回帰的で制御可能なレイアウト生成を可能にする双方向レイアウト変換器を導入する。自己回帰的ベースラインと比較して最大10倍の高速化を達成しながら、6つの多様なレイアウト生成ベンチマークで最先端の性能を維持する。特に高品質な結果を得るために不可欠な、階層的なサンプリング方策を採用している。

ABSTRACT

Creating visual layouts is a critical step in graphic design. Automatic generation of such layouts is essential for scalable and diverse visual designs. To advance conditional layout generation, we introduce BLT, a bidirectional layout transformer. BLT differs from previous work on transformers in adopting non-autoregressive transformers. In training, BLT learns to predict the masked attributes by attending to surrounding attributes in two directions. During inference, BLT first generates a draft layout from the input and then iteratively refines it into a high-quality layout by masking out low-confident attributes. The masks generated in both training and inference are controlled by a new hierarchical sampling policy. We verify the proposed model on six benchmarks of diverse design tasks. Experimental results demonstrate two benefits compared to the state-of-the-art layout transformer models. First, our model empowers layout transformers to fulfill controllable layout generation. Second, it achieves up to 10x speedup in generating a layout at inference time than the layout transformer baseline. Code is released at https://shawnkx.github.io/blt.

研究の動機と目的

  • 自己回帰的レイアウト変換器における、属性の依存関係が固定されているという制限を解消すること。
  • 入力制約に基づいて任意の属性を変更可能な柔軟でユーザー制御可能なレイアウト生成を可能にすること。
  • 自己回帰的変換器と同等またはそれ以上のレイアウト品質を維持しながら、推論速度を向上させること。
  • レイアウト属性間の構造的相関を捉えることで、非自己回帰的レイアウト生成を向上させる階層的サンプリング方策を開発すること。
  • GUI、マガジン、広告、インテリア装飾など多様なデザイン応用分野において、モデルの有効性を検証すること。

提案手法

  • BLTは、学習時に前向きおよび後向きの周囲の属性に注目することで、マスクされた属性を予測する非自己回帰的変換器アーキテクチャを採用する。
  • 推論時、BLTはドラフトレイアウトを生成し、信頼度に基づくマスク選択をガイドする階層的サンプリング方策を用いて、低信頼度の属性を繰り返し精錬する。
  • 階層的サンプリング方策は、属性をグループ(カテゴリ、サイズ、位置)に分類し、事前に定義された順序に従ってマスク生成を制御することで、構造的一致性を向上させる。
  • モデルは双方向自己注意機構を用いて、以前の属性と以降の属性の両方の文脈を予測に反映させ、硬直的な自己回帰的依存関係を打ち破る。
  • 学習では特定の属性グループをマスクし、再構成を最適化するが、推論では信頼度に基づくマスク選択を伴う繰り返し精錬を実行する。
  • 標準的なレイアウト評価指標(IoU、オーバーラップ、アライメント、FID、類似度)を用いて、6つの多様なデータセットで評価が行われる。

実験結果

リサーチクエスチョン

  • RQ1非自己回帰的変換器モデルは、制御可能で条件付きのレイアウト編集を可能にしつつ、高品質なレイアウト生成を達成できるか?
  • RQ2自己回帰的モデルと比較して、双方向注意機構はレイアウト生成品質を向上させるか?
  • RQ3提案された階層的サンプリング方策は、非自己回帰的レイアウト精錬におけるマスク生成を効果的にガイドするか?
  • RQ4自己回帰的ベースラインと比較して、顕著な高速化を達成しつつレイアウト品質を損なわないか?
  • RQ5GUI、マガジン、広告など多様なデザイン分野に一般化可能か?

主な発見

  • BLTは自己回帰的変換器ベースラインと比較して最大10倍の高速化を達成し、特に密度の高いレイアウト(例:20オブジェクトで10倍の高速化)においてその利点が顕著に現れる。
  • 特にユーザー定義の制約を含む属性に対して柔軟に応答できる点で、最先端の自己回帰的およびVAEベースのモデルを上回る性能を示す。
  • 階層的サンプリング方策は、標準的な非自己回帰的ベースラインと比較して顕著に性能を向上させ、RICOデータセットでIoUを0.07、オーバーラップを0.10削減した。
  • PubLayNetデータセットでは、非自己回帰的ベースラインのFID 217をBLTで134に低下させ、レイアウト品質の向上を示した。
  • 無条件レイアウト生成においても競争力のある性能を維持し、RICOでFID 70、PubLayNetでFID 134を達成し、最先端モデルと同等の性能を示した。
  • アブレーションスタディの結果、階層的サンプリング順序(例:カテゴリ → サイズ → 位置)が極めて重要であり、最適でない順序ではIoUおよびアライメントスコアが上昇することが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。