[論文レビュー] SceneFormer: Indoor Scene Generation with Transformers
SceneFormerは、部屋のレイアウトやテキスト記述からオブジェクトのカテゴリ、3次元位置、向き、サイズを予測する変換器ベースの自己回帰モデルを提案する。自己注意機構を活用することで、手動で関係のアノテーションを必要とせずにオブジェクト間の関係を暗黙的に学習する。最先端の手法(FastSynthなど)と比較して、より高速な推論(1.48秒/シーン)と高いユーザーライク(53.9–56.7%)を達成しながら、テキスト条件付き生成においても高い現実性と正確性を維持している。
We address the task of indoor scene generation by generating a sequence of objects, along with their locations and orientations conditioned on a room layout. Large-scale indoor scene datasets allow us to extract patterns from user-designed indoor scenes, and generate new scenes based on these patterns. Existing methods rely on the 2D or 3D appearance of these scenes in addition to object positions, and make assumptions about the possible relations between objects. In contrast, we do not use any appearance information, and implicitly learn object relations using the self-attention mechanism of transformers. We show that our model design leads to faster scene generation with similar or improved levels of realism compared to previous methods. Our method is also flexible, as it can be conditioned not only on the room layout but also on text descriptions of the room, using only the cross-attention mechanism of transformers. Our user study shows that our generated scenes are preferred to the state-of-the-art FastSynth scenes 53.9% and 56.7% of the time for bedroom and living room scenes, respectively. At the same time, we generate a scene in 1.48 seconds on average, 20% faster than FastSynth.
研究の動機と目的
- 視覚的外観や手動でアノテートされたオブジェクト関係に依存せずに、多様で現実的な3次元室内シーンを生成すること。
- 各オブジェクトの属性をシーケンス内のトークンとして扱い、変換器を用いてシーケンス生成タスクとして室内シーン生成をモデル化すること。
- クロスアテンション機構を用いて、部屋のレイアウトと自然言語記述の両方に対して柔軟に条件づけられること。
- 既存の自己回帰的シーン生成手法と比較して、シーンの現実性を維持または向上させつつ、推論速度を向上させること。
- 自己注意機構を通じて、事前に定義された関係ヒューリスティクスやアノテーションを必要とせず、オブジェクト間の空間的・関係的パターンを暗黙的に学習すること。
提案手法
- 各室内シーンを、クラス、3次元位置(離散化済み)、向き、サイズのオブジェクト属性トークンのシーケンスとして表現する。
- 自己回帰的生成に適した変換器デコーダーを用い、以前に生成されたオブジェクトに条件づけて次のオブジェクトの属性を予測する。
- 自己注意機構を活用し、明示的な関係の監視を必要とせず、複雑な空間的・関係的依存関係を暗黙的に学習する。
- ドアや窓の位置および部屋の境界の位置エンコーディングを通じて、部屋のレイアウトを条件づけに活用する。
- テキスト記述を、テキストエンコーダー(例:BERT、ELMo)と変換器デコーダー間のクロスアテンションを用いて条件づけに活用する。
- 3次元座標をボクセルに類似したグリッドに離散化することで、微分可能で効率的なオブジェクト位置予測を可能にする。

実験結果
リサーチクエスチョン
- RQ1変換器ベースのシーケンスモデルは、視覚的外観や事前に定義されたオブジェクト関係を用いずに、現実的な3次元室内シーンを生成できるか?
- RQ2変換器内の自己注意機構は、シーン内のオブジェクト間の空間的・関係的パターンをどれほど暗黙的に学習できるか?
- RQ3テキスト記述を条件づけに用いることで、ベースラインと比較して、オブジェクトカテゴリや空間的関係の生成精度がどの程度向上するか?
- RQ4レイアウトおよびテキスト条件付きのシーン生成を、高い推論速度とユーザーライクで達成できるか?
- RQ5モデルの性能は、異なるシーンタイプ(例:寝室 vs. リビングルーム)や条件づけモodalities によってどのように変化するか?
主な発見
- SceneFormerは平均して1.48秒/シーンでシーンを生成でき、FastSynthより20%高速で、PlanIT や DeepSynth より1桁以上高速である。
- ユーザーライク評価において、寝室シーンでは53.9%、リビングルームシーンでは56.7%の比較で、SceneFormerがFastSynthを上回った。
- テキスト条件付き生成では、BERTエンコーダーのバージョンが、寝室シーンでカテゴリ正確度84.83%、関係正確度46.42%を達成し、GTベースライン(関係正確度10.67%)を著しく上回った。
- 複数の変換器モデル設定により、次のトークン予測正確度が51.5%に向上し、単一の変換器ベースラインから14.5ポイントの向上を示し、アセンブルモデルの利点を示した。
- ELMoとBERTの埋め込みを用いることで、それぞれ76.59%および84.83%のカテゴリ正確度を達成し、入力テキスト記述と強い整合性を示した。
- 知覚的評価では、リアリズムスコア4.61±1.84、テキスト一致スコア4.38±1.73を達成し、生成されたシーンが現実的でかつテキストプロンプトと意味的に整合していることを示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。