Skip to main content
QUICK REVIEW

[論文レビュー] Sketch-A-Shape: Zero-Shot Sketch-to-3D Shape Generation

Aditya Sanghi, Pradeep Kumar Jayaraman|arXiv (Cornell University)|Jul 8, 2023
3D Shape Modeling and Analysis被引用数 6
ひとこと要約

Sketch-A-Shapeは、トレーニング中に合成3Dレンダリングからロバストなセマンティック特徴を、凍結された事前学習済みビジョンモデル(例:CLIP、DINOv2)を用いて抽出することで、トレーニング時にペアのスケッチ-3Dデータを一切必要とせず、推論時にスケッチから多様な3D形状を生成するゼロショットスケッチから3D形状への生成手法を提案する。本手法は、スケッチの抽象度の変化や3D表現(ボクセル、インパルシブ、CAD)の変化に対しても強力な汎化性能を示し、ゼロショットベンチマークで最先端の性能を達成する。

ABSTRACT

Significant progress has recently been made in creative applications of large pre-trained models for downstream tasks in 3D vision, such as text-to-shape generation. This motivates our investigation of how these pre-trained models can be used effectively to generate 3D shapes from sketches, which has largely remained an open challenge due to the limited sketch-shape paired datasets and the varying level of abstraction in the sketches. We discover that conditioning a 3D generative model on the features (obtained from a frozen large pre-trained vision model) of synthetic renderings during training enables us to effectively generate 3D shapes from sketches at inference time. This suggests that the large pre-trained vision model features carry semantic signals that are resilient to domain shifts, i.e., allowing us to use only RGB renderings, but generalizing to sketches at inference time. We conduct a comprehensive set of experiments investigating different design factors and demonstrate the effectiveness of our straightforward approach for generation of multiple 3D shapes per each input sketch regardless of their level of abstraction without requiring any paired datasets during training.

研究の動機と目的

  • 既存のスケッチから3D形状への生成手法の汎化性能を制限している、大規模なペアのスケッチ-3Dデータセットの不足に対処すること。
  • トレーニング時にスケッチ-3Dペアデータを一切必要とせず、ゼロショットで3D形状を生成できることを実現すること。
  • 事前学習済みビジョンモデルの特徴が、レンダリングからスケッチへのドメインシフトに対しても汎化可能かどうかを検証すること。
  • カジュアルなドローイングからプロフェッショナルなデザインまで多様なスケッチタイプ、および複数の3D表現に対して汎化可能な手法を開発すること。
  • アーキテクチャの選択(例:特徴層の選択、コンditioningメカニズム、データオーグメンテーション)が性能に与える影響を評価すること。

提案手法

  • 3D形状から離散的な形状埋め込みを学習するためのVQ-VAEを訓練し、3Dジオメトリのコンパクトな表現を可能にする。
  • トレーニング中に、合成3Dレンダリングに適用された、凍結済みの事前学習済みビジョンモデル(例:CLIP、DINOv2)から抽出された局所的セマンティック特徴で条件づけられたマスクドトランスフォーマーを用いる。
  • 推論時、同じマスクドトランスフォーマーを、同じ凍結済みビジョンエンコーダーを用いて入力スケッチから抽出された特徴で条件づけることで、ゼロショット生成を実現する。
  • ビジョントランスフォーマーの中間層(例:L-14モデルの24層目)からの局所的特徴を、豊富なセマンティックおよび空間的情報を保持する条件信号として用いる。
  • 画像特徴とトランスフォーマーの潜在空間を一致させるために、2層のMLPと学習可能な位置埋め込みを用いたクロスアテンションを持つ学習可能なマッピングネットワークを用いる。
  • アフィン変換、カラーのジャマ、Cannyエッジ検出などのデータオーグメンテーション戦略をトレーニング時に適用し、ロバスト性と汎化性能を向上させる。
Figure 2: An overview of the Sketch-A-Shape method. The top row shows the two training stages. The bottom row shows how 3D shape is generated via sketch at inference time.
Figure 2: An overview of the Sketch-A-Shape method. The top row shows the two training stages. The bottom row shows how 3D shape is generated via sketch at inference time.

実験結果

リサーチクエスチョン

  • RQ1事前学習済みビジョンモデルの特徴は、合成3Dレンダリングから実スケッチへのドメインシフトに対し、ゼロショット設定でも汎化可能か?
  • RQ2ビジョンモデルの層の選択が、スケッチから3D形状への生成品質および正確性に与える影響は?
  • RQ3特徴一致に最適なコンディショニングメカニズム(例:クロスアテンション対自己アテンション)およびマッピングネットワークアーキテクチャは何か?
  • RQ4異なるデータオーグメンテーション戦略が、多様なスケッチデータセットにおけるモデルの汎化性能に与える影響は?
  • RQ5本手法は、ペアのトレーニングデータを一切必要とせず、ボクセル、インパルシブ、CADといった複数の3D表現において、多様で高品質な3D形状を生成可能か?

主な発見

  • L-14ビジョントランスフォーマーの最深層(24層目)からの特徴で条件づけた場合、QD-Accが55.45%、TU-Accが77.15%、SS-Accが74.53%、IS-Accが69.06%を達成する。
  • より深い層を用いることで性能が顕著に向上し、特に24層目が最高の正確性を示しており、深い特徴がよりロバストなセマンティックおよび空間的情報を含んでいることを示している。
  • 2層のMLPとクロスアテンション、学習可能な位置埋め込みを組み合わせたマッピングネットワークが最良の性能(QD-Acc 57.52%、TU-Acc 79.41%、SS-Acc 78.18%、IS-Acc 70.53%)を達成する。
  • 特にアフィン変換およびCannyエッジ変換を含むデータオーグメンテーションの追加により、全体の性能が向上し、フルオーグメンテーションセットではQD-Accが58.96%、TU-Accが81.48%、SS-Accが79.71%、IS-Accが74.20%に達する。
  • 本手法は、カジュアルなドローイングから詳細なプロフェッショナルスケッチまで、スケッチの抽象度の変化に対し効果的に汎化し、一貫した3D形状を生成できる。
  • 本モデルは、ボクセル、インパルシブ、CADといった異なる3D表現においても強い性能を維持しており、再トレーニングを必要とせずに広範な応用が可能であることを示している。
Figure 3: Generated 3D shapes from sketches of different domains. Rows 1–5, and 6 refer to voxel, and implicit representations, respectively. The last three rows show different 3D samples generated per sketch in voxel, implicit, and CAD formats.
Figure 3: Generated 3D shapes from sketches of different domains. Rows 1–5, and 6 refer to voxel, and implicit representations, respectively. The last three rows show different 3D samples generated per sketch in voxel, implicit, and CAD formats.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。