Skip to main content
QUICK REVIEW

[论文解读] Learning to Generate Chairs with Convolutional Neural Networks

Alexey Dosovitskiy, Jost Tobias Springenberg|arXiv (Cornell University)|Nov 21, 2014
Face recognition and analysis被引用 13
一句话总结

本文提出一种在渲染的3D扶手椅模型上进行监督训练的生成式卷积神经网络,基于物体类型、视角和颜色生成扶手椅的新图像。该模型学习到一种有意义的类似3D的表征,能够实现视角之间的插值、零样本生成新型扶手椅风格,并在跨扶手椅对应匹配方面优于以往方法。

ABSTRACT

We train a generative convolutional neural network which is able to generate images of objects given object type, viewpoint, and color. We train the network in a su-pervised manner on a dataset of rendered 3D chair mod-els. Our experiments show that the network does not merely learn all images by heart, but rather finds a meaningful representation of a 3D chair model allowing it to assess the similarity of different chairs, interpolate between given viewpoints to generate the missing ones, or invent new chair styles by interpolating between chairs from the training set. We show that the network can be used to find correspon-dences between different chairs from the dataset, outper-forming existing approaches on this task. 1.

研究动机与目标

  • 开发一种深度生成模型,通过视角和颜色等条件输入合成逼真的扶手椅图像。
  • 通过学习扶手椅几何结构的解耦且有意义的表征,使模型能够超越对训练图像的记忆化,实现泛化。
  • 展示模型在视角之间进行插值以及生成训练数据中未出现的新型扶手椅风格的能力。
  • 在扶手椅对应匹配任务上评估模型性能,优于现有方法。

提出的方法

  • 在大规模2D渲染扶手椅3D模型图像数据集上,以监督方式训练卷积神经网络。
  • 网络接收一个包含物体类型、视角(方位角、仰角)和颜色的条件嵌入作为输入,并生成对应的图像。
  • 该模型学习到一种解耦的潜在表征,捕捉扶手椅的结构与外观因素,从而支持视角和风格之间的插值。
  • 网络架构利用转置卷积层对特征进行上采样,从学习到的表征生成高分辨率图像。
  • 训练使用像素级重建损失,以确保生成图像与真实渲染图像的保真度。
  • 分析模型内部表征,以评估其在零样本生成和对应匹配任务中的能力。

实验结果

研究问题

  • RQ1在2D渲染的3D扶手椅图像上进行训练的CNN,是否能学习到超越对训练数据简单记忆的有意义的类似3D的表征?
  • RQ2该模型在未见过的视角之间插值时,能多大程度上生成合理且连贯的中间视角?
  • RQ3通过在潜在空间中对不同扶手椅进行插值,模型能否生成新颖的扶手椅风格?
  • RQ4与现有方法相比,该学习到的表征是否能提升跨扶手椅对应匹配的性能?

主要发现

  • 该模型生成的扶手椅图像在视觉上合理且具备泛化能力,表明其已学习到有意义的类似3D的表征。
  • 该模型成功实现了视角之间的插值,生成了训练数据中未包含的连贯中间视图。
  • 通过在潜在空间中对不同扶首椅进行插值,模型能够生成新颖的扶手椅风格,展示了创造性泛化能力。
  • 学习到的表征在跨扶手椅对应匹配任务上的表现优于以往最先进方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。