Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Image to Sequence Translation with Canvas-Drawer Networks

Kevin Frans, Chin-Yi Cheng|arXiv (Cornell University)|Sep 21, 2018
Advanced Vision and Imaging参考文献 11被引用 11
一句话总结

本文提出了一种用于无监督图像到序列翻译的画布绘制者框架,通过训练一个可微分的画布网络来近似不可微分的渲染器,从而实现绘制者网络的端到端训练,以从像素图像生成可解释的高层级序列(例如,笔画、矩形),且无需成对数据。该方法成功地将MNIST数字、平面图和3D场景转化为高保真度的结构化序列,并展现出对分布外样本的良好泛化能力。

ABSTRACT

Encoding images as a series of high-level constructs, such as brush strokes or discrete shapes, can often be key to both human and machine understanding. In many cases, however, data is only available in pixel form. We present a method for generating images directly in a high-level domain (e.g. brush strokes), without the need for real pairwise data. Specifically, we train a "canvas" network to imitate the mapping of high-level constructs to pixels, followed by a high-level "drawing" network which is optimized through this mapping towards solving a desired image recreation or translation task. We successfully discover sequential vector representations of symbols, large sketches, and 3D objects, utilizing only pixel data. We display applications of our method in image segmentation, and present several ablation studies comparing various configurations.

研究动机与目标

  • 实现从像素图像到可解释的高层级序列(例如,笔画、矩形)的无监督翻译,且无需成对训练数据。
  • 解决在真实图像-序列对不可用或收集成本过高的情况下训练序列生成模型的挑战。
  • 开发对不可微分渲染程序(例如,数字绘画软件、3D引擎)的可微分近似,以支持基于梯度的优化。
  • 通过滑动窗口和分层架构实现对高分辨率图像和复杂序列的泛化。
  • 在多种领域中展示方法的适用性,包括2D草图、彩色矢量图、建筑平面图和3D场景重建。

提出的方法

  • 通过从实际渲染程序中采样状态-动作对的轨迹,训练画布网络以模仿不可微分渲染器的行为。
  • 画布网络为渲染器提供了一个可微分的代理,从而支持通过渲染过程进行反向传播,以训练绘制者网络。
  • 绘制者网络生成一系列高层级动作(例如,贝塞尔曲线、矩形放置),当通过画布网络处理时,能够重建目标像素图像。
  • 引入滑动窗口和分层架构,以将该方法扩展至高分辨率图像(例如,512×512)和长序列动作。
  • 通过最小化生成图像(经由画布网络)与目标图像之间的像素级重建损失,实现框架的端到端训练。
  • 通过将绘制者网络作为可微分策略,最小化画布重建图像与目标图像之间的像素距离,将该方法应用于翻译任务。

实验结果

研究问题

  • RQ1可微分画布网络能否有效近似不可微分渲染器,从而实现序列生成绘制者网络的端到端训练?
  • RQ2画布-绘制者框架在训练期间未见过的分布外图像上的泛化能力如何?
  • RQ3通过滑动窗口和分层架构,该框架能否扩展至高分辨率图像和长序列?
  • RQ4该方法在零样本翻译任务中的有效性如何,例如,将灰度MNIST数字转换为彩色矢量图而无需成对数据?
  • RQ5该框架能否通过从2D观测中生成3D长方体来扩展至3D领域,且无需成对数据?

主要发现

  • 画布-绘制者框架成功学习将灰度MNIST数字翻译为彩色贝塞尔曲线序列,无需成对数据,实现了颜色和形状的精确再现。
  • 该方法在分布外样本(如未见过的符号和草图)上表现出良好的泛化能力,表明其具备鲁棒性与解耦表征学习能力。
  • 在建筑平面图任务中,绘制者网络生成了与目标像素布局高度一致的可解释、参数化的边界框分割。
  • 在3D重建任务中,该框架仅使用像素数据和无成对训练样本,即可从三个2D正交视图中准确恢复3D长方体。
  • 消融研究显示,增加绘制步骤数量并采用分层架构可提升重建质量和泛化能力。
  • 在需要结构化、人类可读输出(如矢量图和房间分割)的任务中,该方法在稳定性和可解释性方面优于基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。