Skip to main content
QUICK REVIEW

[论文解读] BEVControl: Accurately Controlling Street-view Elements with Multi-perspective Consistency via BEV Sketch Layout

Kairui Yang, Enhui Ma|arXiv (Cornell University)|Aug 3, 2023
Advanced Vision and Imaging被引用 4
一句话总结

BEVControl 提出了一种两阶段生成式框架,利用可编辑的鸟瞰图草图布局,精确控制多视角街景图像中的前景和背景元素,实现了卓越的几何一致性和外观一致性。与 BEVGen 相比,其前景分割 mIoU 提升了 20.91 个百分点,达到 26.80,且在用于数据增强时,平均使下游感知模型的 NDS 得分提升 1.29 分。

ABSTRACT

Using synthesized images to boost the performance of perception models is a long-standing research challenge in computer vision. It becomes more eminent in visual-centric autonomous driving systems with multi-view cameras as some long-tail scenarios can never be collected. Guided by the BEV segmentation layouts, the existing generative networks seem to synthesize photo-realistic street-view images when evaluated solely on scene-level metrics. However, once zoom-in, they usually fail to produce accurate foreground and background details such as heading. To this end, we propose a two-stage generative method, dubbed BEVControl, that can generate accurate foreground and background contents. In contrast to segmentation-like input, it also supports sketch style input, which is more flexible for humans to edit. In addition, we propose a comprehensive multi-level evaluation protocol to fairly compare the quality of the generated scene, foreground object, and background geometry. Our extensive experiments show that our BEVControl surpasses the state-of-the-art method, BEVGen, by a significant margin, from 5.89 to 26.80 on foreground segmentation mIoU. In addition, we show that using images generated by BEVControl to train the downstream perception model, it achieves on average 1.29 improvement in NDS score.

研究动机与目标

  • 为解决基于鸟瞰图的图像生成中对前景和背景细节(尤其是物体朝向与空间布局)缺乏细粒度控制的问题。
  • 通过用更易于人类修改的草图风格鸟瞰图布局替代分割图,实现更灵活、可编辑的控制输入。
  • 提升生成场景中鸟瞰图与街景视角之间的多视角视觉一致性与几何保真度。
  • 建立全面的评估协议,公平衡量在场景、前景和背景层面的性能表现。
  • 证明生成图像在增强真实世界数据集以训练鲁棒的鸟瞰图感知模型方面的有效性。

提出的方法

  • BEVControl 采用基于 UNet 的两阶段生成网络,配备专用的控制器与协调器模块,分别实现几何与外观控制。
  • 控制器利用自注意力机制编码来自鸟瞰图布局的前景与背景草图提示,生成几何一致的街景特征。
  • 协调器应用一种新颖的跨视角-跨元素注意力机制,以在多个相机视角间强制实现视觉一致性。
  • 通过交叉注意力机制集成文本提示,指导外观生成,同时保持与鸟瞰图草图的几何对齐。
  • 该方法将控制解耦为前景与背景的独立处理流,实现更专注、更精确的操控。
  • 使用单一注意力层,将前景与背景提示联合嵌入潜在空间,实现统一控制。

实验结果

研究问题

  • RQ1与基于分割图的输入相比,基于草图的鸟瞰图布局是否能在多视角街景图像生成中实现更精确、更易编辑的前景与背景元素控制?
  • RQ2如何通过控制器设计提升鸟瞰图与街景视角之间的几何一致性?
  • RQ3协调器中引入的跨视角与跨元素注意力机制在多角度视觉一致性方面能提升到何种程度?
  • RQ4BEVControl 是否能生成多样化、逼真且几何准确的场景,从而提升下游感知模型的性能?
  • RQ5在 mIoU、CLIP 分数和 NDS 准确率方面,该方法与当前最先进方法相比在量化指标上表现如何?

主要发现

  • BEVControl 实现了 26.80 的前景分割 mIoU,显著优于 BEVGen 的 5.89,证明其在物体生成中具有更优的几何精度。
  • 当使用 BEVControl 增强的数据进行训练时,下游 BEVFormer 目标检测模型的 NDS 得分平均提升 1.29 分。
  • 在完整协调器配置下,跨视角视觉一致性的 CLIP 分数达到 82.70,表明跨视角与跨元素注意力机制显著增强了外观一致性。
  • 消融实验表明,采用独立处理前景与背景的完整控制器,其控制效果优于联合处理方式。
  • 可视化结果表明,BEVControl 准确捕捉了草图中指定的物体朝向与道路布局,而基线方法常出现车辆朝向反转的问题。
  • 使用草图输入相比逐像素编辑分割图,能实现更快、更直观的编辑,显著提升数据增强的可用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。