Skip to main content
QUICK REVIEW

[논문 리뷰] ILV: Iterative Latent Volumes for Fast and Accurate Sparse-View CT Reconstruction

Seungryong Lee, Woojeong Baek|arXiv (Cornell University)|2026. 03. 16.
Medical Imaging Techniques and Applications인용 수 0
한 줄 요약

ILV는 다중 시야 X-ray 특징과 학습된 Priors를 주입하여 점진적으로 다듬은 명시적 3D 잠재 볼륨을 도입해 빠르고 정확한 희소 시야 CBCT 재구성과 새로운 뷰 합성을 달성합니다. 이는 기존의 피드포워드 및 최적화 기반 방법보다 우수한 품질과 속도를 제공하며 거의 실시간 추론에 근접합니다.

ABSTRACT

A long-term goal in CT imaging is to achieve fast and accurate 3D reconstruction from sparse-view projections, thereby reducing radiation exposure, lowering system cost, and enabling timely imaging in clinical workflows. Recent feed-forward approaches have shown strong potential toward this overarching goal, yet their results still suffer from artifacts and loss of fine details. In this work, we introduce Iterative Latent Volumes (ILV), a feed-forward framework that integrates data-driven priors with classical iterative reconstruction principles to overcome key limitations of prior feed-forward models in sparse-view CBCT reconstruction. At its core, ILV constructs an explicit 3D latent volume that is repeatedly updated by conditioning on multi-view X-ray features and the learned anatomical prior, enabling the recovery of fine structural details beyond the reach of prior feed-forward models. In addition, we develop and incorporate several key architectural components, including an X-ray feature volume, group cross-attention, efficient self-attention, and view-wise feature aggregation, that efficiently realize its core latent volume refinement concept. Extensive experiments on a large-scale dataset of approximately 14,000 CT volumes demonstrate that ILV significantly outperforms existing feed-forward and optimization-based methods in both reconstruction quality and speed. These results show that ILV enables fast and accurate sparse-view CBCT reconstruction suitable for clinical use. The project page is available at: https://sngryonglee.github.io/ILV/.

연구 동기 및 목표

  • radiation 노출 감소 및 임상 워크플로우 개선을 위해 빠르고 정확한 희소 시야 CT 재구성을 목표로 함.
  • 다중 시야 X-ray 특징과 priors를 사용하여 CT 볼륨을 반복적으로 다듬는 3D 잠재 볼륨 프레임워크(ILV) 제안.
  • 3D 잠재량 개선을 가능하게 하는 아키텍처 구성요소(X-ray 특징 볼륨, 그룹 교차 주의, 효율적 자기 주의, 시야별 집계)를 도입하여 확장 가능한 3D 잠재량 개선을 실현.
  • ILV가 기존의 피드포워드 및 최적화 기반 방법보다 품질과 속도에서 우수함을 대규모 실험으로 입증하고 새 뷰 합성 기능도 포함한다.

제안 방법

  • 다중 시야 X-ray 특징과 학습된 priors에 조건을 두고 명시적 3D 잠재 볼륨을 구성하고 이를 반복적으로 개선한다.
  • 다중 시야 X-ray 이미지로부터 고-저수준 특징을 3D 공간으로 역투영하여 X-ray 특징 볼륨을 생성한다.
  • X-ray 특징 볼륨과 잠재 볼륨 간에 그룹 교차 주의를 적용하여 다중 시야 정보 주입을 효율화한다.
  • 잠재 볼륨 내에서 효율적 자기 주의를 사용해 전역 맥락을 낮은 복잡도로 포착한다.
  • X-ray 특징 볼륨의 시야별 평균-최대 특징을 도입해 시야 간 일관성을 강화한다.
  • 개선된 잠재 볼륨을 가우시안 프리미티브로 디코드하고 차별화 가능한 가우시안 렌더러로 투영한 후 CT 볼륨에 대해 3D U-Net 보정으로 정제한다.
  • 종단 간 학습으로 합성 손실을 최적화한다: 그라운드 트루스에 대한 체적 MSE, 이미지 공간 L1/SSIM 렌더링 손실, 안정화 후의 보정 MSE를 포함한 복합 손실.

실험 결과

연구 질문

  • RQ1학습된 priors와 다중 시야 X-ray 정보를 이용해 명시적 3D 잠재 볼륨을 반복적으로 개선하면 희소 시야 CT 재구성에서 우수한 성능을 달성할 수 있는가?
  • RQ2아키텍처 선택(그룹 교차 주의, 효율적 자기 주의, 시야별 집계)이 재구성 품질과 효율성에 어떻게 영향을 미치는가?
  • RQ3ILV 프레임워크가 희소 시야 조건에서 고품질 CT 재구성과 신뢰할 수 있는 새로운 시야 X-ray 합성을 달성할 수 있는가?
  • RQ4학습된 priors가 데이터셋 간에 일반화되며 최적화 기반 방법에 비해 거의 실시간 성능을 가능하게 하는가?

주요 결과

  • ILV는 6-, 8-, 10-뷰 설정에서 최첨단 PSNR/SSIM을 달성하며, 주표의 10-뷰 PSNR은 33.84 dB, SSIM은 0.924이다.
  • ILV는 각 케이스를 1초 미만으로 재구성하여 거의 실시간 성능을 제공하면서 3D 피드포워드 및 최적화 기반 기준선보다 우수한 성능을 보임.
  • 24-뷰 설정 하에서 ILV는 PSNR이 R2-Gaussian보다 약 2.6 dB 높고 가장 빠른 최적화 기반 기준선 대비 약 400배 빠름.
  • 데이터셋 간 평가에서 ILV가 재학습 없이 FUMPE와 PENGWIN에서 다수의 기준선보다 일반화가 더 잘 되는 것으로 나타남.
  • 절삭 연구에서 반복적 다중 시야 주입 및 3D U-Net 정제가 성능에 의미 있게 기여하며, 전체 ILV가 최상의 결과를 달성함.
  • LPIPS를 이용한 인지적 미세조정은 인지적 오류를 줄이면서도 높은 PSNR/SSIM을 유지함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.