Skip to main content
QUICK REVIEW

[논문 리뷰] BEVControl: Accurately Controlling Street-view Elements with Multi-perspective Consistency via BEV Sketch Layout

Kairui Yang, Enhui Ma|arXiv (Cornell University)|2023. 08. 03.
Advanced Vision and Imaging인용 수 4
한 줄 요약

BEVControl는 다중 시점 스트리트 뷰 이미지에서 전경 및 배경 요소를 정확하게 제어하기 위해 편집 가능한 BEV 스케치 레이아웃을 사용하는 이단계 생성 프레임워크를 제안한다. 이는 기하학적 일致성과 외관 일致성을 향상시킨다. BEVGen 대비 전경 세그멘테이션 mIoU를 20.91 포인트 향상시켜 26.80에 도달하였으며, 데이터 증강에 사용할 경우 후행 인식 모델의 NDS 점수를 평균 1.29 포인트 향상시킨다.

ABSTRACT

Using synthesized images to boost the performance of perception models is a long-standing research challenge in computer vision. It becomes more eminent in visual-centric autonomous driving systems with multi-view cameras as some long-tail scenarios can never be collected. Guided by the BEV segmentation layouts, the existing generative networks seem to synthesize photo-realistic street-view images when evaluated solely on scene-level metrics. However, once zoom-in, they usually fail to produce accurate foreground and background details such as heading. To this end, we propose a two-stage generative method, dubbed BEVControl, that can generate accurate foreground and background contents. In contrast to segmentation-like input, it also supports sketch style input, which is more flexible for humans to edit. In addition, we propose a comprehensive multi-level evaluation protocol to fairly compare the quality of the generated scene, foreground object, and background geometry. Our extensive experiments show that our BEVControl surpasses the state-of-the-art method, BEVGen, by a significant margin, from 5.89 to 26.80 on foreground segmentation mIoU. In addition, we show that using images generated by BEVControl to train the downstream perception model, it achieves on average 1.29 improvement in NDS score.

연구 동기 및 목표

  • BEV 기반 이미지 생성에서 전경 및 배경 세부 사항에 대한 세밀한 제어가 부족한 문제를 해결하기 위해, 특히 객체 방향 및 공간 레이아웃 측면에서.
  • 사람이 수정하기 쉬운 스케치 스타일의 BEV 레이아웃으로 세그멘테이션 맵을 대체함으로써 더 유연하고 편집 가능한 제어 입력을 가능하게 하기 위해.
  • 생성된 장면에서 Bird's-eye view와 스트리트 레벨 뷰 간의 다중 시점 시각 일관성과 기하학적 정확성을 향상시키기 위해.
  • 장면, 전경, 배경 수준에서 성능을 공정하게 측정할 수 있는 종합적인 평가 프로토콜을 개발하기 위해.
  • 실세계 데이터셋을 증강하여 강력한 BEV 인식 모델을 훈련시키는 데에 생성된 이미지의 효과성을 입증하기 위해.

제안 방법

  • 기하학적 제어와 외관 제어를 위해 전용 컨트롤러 및 코ordinating 모듈을 갖춘 이단계 UNet 기반 생성 네트워크를 사용한다.
  • 컨트롤러는 BEV 레이아웃에서 전경 및 배경 스케치 힌트를 자기주의 어텐션(self-attention)을 통해 인코딩하여 기하학적으로 일관된 스트리트 뷰 특징을 생성한다.
  • 코ordinating 모듈은 새로운 크로스뷰-크로스엘리먼트 어텐션 메커니즘을 적용하여 여러 카메라 뷰 간의 시각 일관성을 강제한다.
  • 크로스어텐션을 통해 텍스트 프롬프트를 통합하여 외관 생성을 안내하면서도 BEV 스케치와 기하학적 정렬을 유지한다.
  • 전경과 배경에 대해 별도의 스트림으로 제어를 분리함으로써 더 집중적이고 정확한 조작을 가능하게 한다.
  • 전경 및 배경 힌트를 동시에 잠재 공간에 통합하기 위해 단일 어텐션 레이어를 사용한다.

실험 결과

연구 질문

  • RQ1세그멘테이션 기반 입력에 비해 스케치 기반 BEV 레이아웃이 다중 시점 스트리트 뷰 이미지 생성에서 전경 및 배경 요소에 대해 더 정확하고 편집 가능한 제어를 가능하게 하는가?
  • RQ2컨트롤러 설계를 통해 Bird's-eye view와 스트리트 레벨 뷰 간의 기하학적 일관성을 어떻게 향상시킬 수 있는가?
  • RQ3코ordinating 모듈의 크로스뷰 및 크로스엘리먼트 어텐션은 여러 카메라 시점 간의 시각 일관성을 어느 정도 향상시키는가?
  • RQ4BEVControl은 다양하고 현실적이며 기하학적으로 정확한 장면을 생성하여 후행 인식 모델의 성능을 향상시킬 수 있는가?
  • RQ5mIoU, CLIP 점수, NDS 정확도 측면에서 제안된 방법이 최신 기술 대비 정량적으로 어떻게 비교되는가?

주요 결과

  • BEVControl은 전경 세그멘테이션 mIoU 26.80을 달성하여 BEVGen의 5.89에 비해 뚜렷이 높은 기하학적 정확도를 입증한다.
  • BEVControl으로 증강된 데이터로 훈련된 후행 BEVFormer 객체 검출 모델의 NDS 점수가 평균 1.29 포인트 향상된다.
  • 전체 코ordinating 모듈을 사용할 경우 뷰 간 시각 일관성에 대한 CLIP 점수는 82.70에 도달하여 크로스뷰 및 크로스엘리먼트 어텐션의 효과적인 외관 공명성을 보여준다.
  • 절단 실험(ablation studies) 결과, 전경 및 배경에 대해 별도의 스트림을 갖춘 완전한 컨트롤러가 통합 처리보다 더 나은 제어 성능을 보인다.
  • 시각화 결과 BEVControl은 스케치에 명시된 객체 방향과 도로 레이아웃을 정확히 반영하는 것으로 나타났으며, 기준 모델들이 자주 차량 방향을 뒤집는 것과는 대조된다.
  • 스케치 입력을 사용함으로써 픽셀 수준의 세그멘테이션 맵 편집보다 더 빠르고 직관적인 편집이 가능해져 데이터 증강의 사용성 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.