Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Infer and Execute 3D Shape Programs

Yonglong Tian, Andrew Luo|arXiv (Cornell University)|2019. 01. 09.
3D Shape Modeling and Analysis참고 문헌 41인용 수 50
한 줄 요약

이 논문은 3D 형태 프로그램, 드로잉 및 루프 구문을 포함하는 DSL과 신경망 파이프라인(프로그램 생성기 + 신경망 프로그램 실행기)을 제시하여 이러한 프로그램을 추론하고 실행해 자기지도 학습 방식으로 3D 모양을 재구성하며 ShapeNet에 대한 가이드된 적응 및 이미지로부터의 형태 인지 확장까지 수행한다.

ABSTRACT

Human perception of 3D shapes goes beyond reconstructing them as a set of points or a composition of geometric primitives: we also effortlessly understand higher-level shape structure such as the repetition and reflective symmetry of object parts. In contrast, recent advances in 3D shape sensing focus more on low-level geometry but less on these higher-level relationships. In this paper, we propose 3D shape programs, integrating bottom-up recognition systems with top-down, symbolic program structure to capture both low-level geometry and high-level structural priors for 3D shapes. Because there are no annotations of shape programs for real shapes, we develop neural modules that not only learn to infer 3D shape programs from raw, unannotated shapes, but also to execute these programs for shape reconstruction. After initial bootstrapping, our end-to-end differentiable model learns 3D shape programs by reconstructing shapes in a self-supervised manner. Experiments demonstrate that our model accurately infers and executes 3D shape programs for highly complex shapes from various categories. It can also be integrated with an image-to-shape module to infer 3D shape programs directly from an RGB image, leading to 3D shape reconstructions that are both more accurate and more physically plausible.

연구 동기 및 목표

  • 로컬 기하학과 고수준 구조(대칭, 반복)를 모두 포착하는 표현으로서 3D 형태 프로그램을 소개한다.
  • 라벨이 없는 형태에서 모양 프로그램을 추론하고 재구성을 위한 실행을 수행하는 신경망 파이프라인을 개발한다.
  • 미분가능한 프로그램 실행기를 통해 역전파가 가능한 엔드-투-엔드 학습을 가능하게 한다.
  • 가이드된 적응을 통해 실제 데이터셋(ShapeNet, Pix3D)에의 적응을 시연한다.
  • RGB 이미지로부터 직접 형태 프로그램을 추론하고 실행 파이프라인으로 재구성 및 타당성을 향상시키는 확장을 보여준다.]
  • method3-6? Please fix.
  • method번역은 아래에 별도로 제공됩니다.
  • 이 부분은 내부 구성과 중복으로 보정이 필요합니다.

제안 방법

  • 3D 형태를 위한 도메인 특화 언어(DSL)를 정의하여 부분과 규칙성을 모델링하기 위해 Draw 및 For 구문을 사용한다.
  • 블록 LSTM과 Step LSTM로 블록 수준 및 블록별 프로그램 토큰을 예측하는 이중 계층 프로그램 생성기를 구현한다.
  • 프로그램에서 모양을 렌더링하고 역전파 가능한 학습을 가능하게 하는 신경망 프로그램 실행기(LSTM + 3D 디콘볼루션)를 만든다.
  • 합성 블록-프로그램–모양 페어에서 실행기를 학습시켜 엔드-투-엔드 역전파를 통한 프로그램 합성을 가능하게 한다.
  • 미리 학습된 생성기를 ShapeNet에 맞추기 위해 얼린 실행기를 통한 재구성 손실 최소화를 통해 Guided Adaptation(GA)을 사용한다.
  • IoU, Chamfer Distance(CD), Earth Mover’s Distance(EMD)로 평가하고 보이지 않는 카테고리 및 Pix3D에 대한 일반화 테스트를 수행한다.

실험 결과

연구 질문

  • RQ1비라벨 형태에서 해석 가능한 3D 형태 프로그램을 신경망 모델이 추론할 수 있는가?
  • RQ2미분가능한 프로그램 실행기가 3D 형태 재구성에 대해 엔드-투-엔드 학습을 가능하게 하는가?
  • RQ3가이드된 적응이 ShapeNet과 같은 실제 데이터에 대한 일반화를 향상시키는가?
  • RQ4RGB 이미지를 통해 프로그램 실행 파이프라인으로 직접 형태를 추론하고 재구성할 수 있는가?

주요 결과

  • 합성 데이터에서 프로그램 생성기가 입력 모양과 재구성 모양 간의 토큰 정확도 99.9% 이상 및 IoU 0.991를 달성한다.
  • 신경망 프로그램 실행기가 단일 드로잉 문에서 IoU 0.93, 복합 문에서 IoU 0.88를 달성한다.
  • GA 없는 Shape Programs는 IoU가 표 0.487, 의자 0.422인 반면 GA를 사용하면 표 0.591, 의자 0.516으로 향상된다.
  • CD는 GA 없이 표 0.067에서 0.058로, 의자에서 0.072에서 0.063으로 개선되며 GA로 CD가 0.067에서 0.058(표), 0.072에서 0.060(의자)로 개선된다.
  • 가이드된 적응은 안정성/연결성의 큰 향상을 가져다준다: 안정성 비율은 표 97.0%, 의자 96.5%로 상승; 안정적 및 연결된 비율은 표 77.0%, 의자 66.0%로 상승한다.
  • 보지 않은 카테고리 일반화가 GA로 크게 향상된다(예: 침대 IoU 0.37로 0.23에서 증가; 소파 0.60로 0.30에서 증가; 수납장 0.48로 0.25에서 증가; 벤치 0.42로 0.18에서 증가).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.