Skip to main content
QUICK REVIEW

[論文レビュー] Sketch-BERT: Learning Sketch Bidirectional Encoder Representation from Transformers by Self-supervised Learning of Sketch Gestalt

Hangyu Lin, Yanwei Fu|arXiv (Cornell University)|May 19, 2020
Advanced Image and Video Retrieval Techniques参考文献 31被引用数 8
ひとこと要約

Sketch-BERTは、トランスフォーマーに基づくアーキテクチャを用いて、マスクされた点の位置と状態を予測する独創的なスケッチ・ゲシュタルト(sGesta)タスクを導入することで、自己教師あり事前学習フレームワークを提案する。このタスクでQuickDrawデータセットを事前学習することで、スケッチ認識、検索、生成的再構成の分野で最先端の性能を達成し、ベースラインモデルに比べて下流タスクの収束と精度が著しく向上する。

ABSTRACT

Previous researches of sketches often considered sketches in pixel format and leveraged CNN based models in the sketch understanding. Fundamentally, a sketch is stored as a sequence of data points, a vector format representation, rather than the photo-realistic image of pixels. SketchRNN studied a generative neural representation for sketches of vector format by Long Short Term Memory networks (LSTM). Unfortunately, the representation learned by SketchRNN is primarily for the generation tasks, rather than the other tasks of recognition and retrieval of sketches. To this end and inspired by the recent BERT model, we present a model of learning Sketch Bidirectional Encoder Representation from Transformer (Sketch-BERT). We generalize BERT to sketch domain, with the novel proposed components and pre-training algorithms, including the newly designed sketch embedding networks, and the self-supervised learning of sketch gestalt. Particularly, towards the pre-training task, we present a novel Sketch Gestalt Model (SGM) to help train the Sketch-BERT. Experimentally, we show that the learned representation of Sketch-BERT can help and improve the performance of the downstream tasks of sketch recognition, sketch retrieval, and sketch gestalt.

研究の動機と目的

  • スケッチを2次元画像として扱うCNNベースのモデルの限界に対処する。
  • 認識、検索、生成タスクのすべてに一般化可能な汎用的スケッチ表現モデルを開発する。
  • ゲシュタルト原理を活用してマスクされたスケッチ点を回復する、独創的な自己教師あり事前学習タスク「スケッチゲシュタルト」を導入する。
  • ドメイン固有の埋め込みと洗練されたアーキテクチャを用いて、BERTフレームワークをスケッチドメインに適応する。
  • スケッチゲシュタルトによる事前学習が下流タスクの性能向上と収束加速をもたらすことを実証する。

提案手法

  • スケッチの順序付きベクトルデータに特化した、点、位置、ストロークの3段階埋め込みを提案する。
  • 生のスケッチトークンをトランスフォーマー入力空間に射影するための精緻化埋め込みネットワークを導入する。
  • BERTのマスク言語モデルにインspiredされた、マスクされたスケッチ点の連続的座標と離散的状態値を予測する、独創的なスケッチゲシュタルトモデル(SGM)を設計する。
  • 自己注意機構を用いた、重み共有のマルチヘッド、トランスフォーマー変換器エンコーダーを採用し、スケッチ系列内の長距離依存関係をモデル化する。
  • 二重目的の自己教師あり事前学習タスクを採用:マスクされた位置予測とマスクされた状態予測。
  • スケッチ分類、検索、ゲシュタルト再構成などの下流タスクで、事前学習済みのSketch-BERTを微調整する。

実験結果

リサーチクエスチョン

  • RQ1BERT風のトランスフォーマーモデルは、順序付きベクトルデータとしてのスケッチ表現を、効果的に学習できるか?
  • RQ2マスクされたスケッチ点を回復する「スケッチゲシュタルト」タスクによる自己教師あり事前学習は、下流タスクにおけるスケッチ理解性能を向上させるか?
  • RQ3深さ、幅、埋め込み設計といったアーキテクチャ的選択が、スケッチタスクにおけるSketch-BERTの性能に与える影響は何か?
  • RQ4大規模スケッチデータで事前学習することで、下流タスクの収束に必要なトレーニングエポック数を削減できるか?
  • RQ5生成的スケッチ再構成タスクにおいて、Sketch-BERTはCNNベースのモデルに比べて優れているか?

主な発見

  • スケッチ分類タスクにおいて、Top-1精度が88.30%、Top-5精度が97.82%を達成し、ベースラインモデルを上回る性能を示した。
  • スケッチ検索タスクでは、Top-1精度85.47%、Top-5精度93.49%を達成し、優れた一般化性能を示した。
  • QuickDrawから70,000件のサンプルで事前学習することで、収束に必要なトレーニングエポック数が約50から約5にまで削減された。
  • 8層、12ヘッド、768次元の隠れ層サイズ(8-12-768)のアーキテクチャが、性能と収束のバランスを最良に達成した。
  • スケッチゲシュタルトタスクは非常に効果的であった:CNNベースのモデルはアーティファクトのため、複雑なスケッチの再構成に失敗したが、Sketch-BERTは構造的・意味的パターンを的確に学習した。
  • クラスあたりのトレーニングサンプル数を増やすことで、Top-1精度が最大3%向上したが、クラス数の増加には顕著な向上が見られなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。