Skip to main content
QUICK REVIEW

[論文レビュー] ILV: Iterative Latent Volumes for Fast and Accurate Sparse-View CT Reconstruction

Seungryong Lee, Woojeong Baek|arXiv (Cornell University)|Mar 16, 2026
Medical Imaging Techniques and Applications被引用数 0
ひとこと要約

ILVは、マルチビューX線特徴量と学習済み priors を注入して反復的に精練される明示的な3D潜在ボリュームを導入し、スパースビュー CBCT 再構成と新規視点合成を高速かつ高精度に実現します。従来の前方伝播型および最適化ベースの手法を上回りながら、ほぼリアルタイム推論を提供します。

ABSTRACT

A long-term goal in CT imaging is to achieve fast and accurate 3D reconstruction from sparse-view projections, thereby reducing radiation exposure, lowering system cost, and enabling timely imaging in clinical workflows. Recent feed-forward approaches have shown strong potential toward this overarching goal, yet their results still suffer from artifacts and loss of fine details. In this work, we introduce Iterative Latent Volumes (ILV), a feed-forward framework that integrates data-driven priors with classical iterative reconstruction principles to overcome key limitations of prior feed-forward models in sparse-view CBCT reconstruction. At its core, ILV constructs an explicit 3D latent volume that is repeatedly updated by conditioning on multi-view X-ray features and the learned anatomical prior, enabling the recovery of fine structural details beyond the reach of prior feed-forward models. In addition, we develop and incorporate several key architectural components, including an X-ray feature volume, group cross-attention, efficient self-attention, and view-wise feature aggregation, that efficiently realize its core latent volume refinement concept. Extensive experiments on a large-scale dataset of approximately 14,000 CT volumes demonstrate that ILV significantly outperforms existing feed-forward and optimization-based methods in both reconstruction quality and speed. These results show that ILV enables fast and accurate sparse-view CBCT reconstruction suitable for clinical use. The project page is available at: https://sngryonglee.github.io/ILV/.

研究の動機と目的

  • 放射線被曝を低減し臨床ワークフローを改善するための高速かつ正確なスパースビューCT再構成の動機付け。
  • マルチビューX線特徴量とpriorsを用いてCTボリュームを反復的に精練する3D潜在ボリュームフレームワーク(ILV)の提案。
  • 3D潜在ボリュームのスケーラブルな refinement を可能にするアーキテクチャ要素(X線特徴量ボリューム、グループクロスアテンション、効率的自己アテンション、ビューごとの集約)を組み込む。
  • ILV が既存の前方伝播型および最適化ベースの手法を品質と速度の点で凌駕し、新規視点合成機能を含むことを、大規模実験を通じて実証する。

提案手法

  • 明示的な3D潜在ボリュームを構築し、マルチビューX線特徴量と学習済みpriorsによって条件付けることで反復的に精練する。
  • マルチビューX線画像から高レベルおよび低レベル特徴を3D空間にバックプロジェクションしてX線特徴量ボリュームを作成する。
  • X線特徴量ボリュームと潜在ボリューム間でグループクロスアテンションを適用し、効率的なマルチビュー情報注入を可能にする。
  • 潜在ボリューム内で効率的な自己アテンションを使用して、計算量を抑えつつグローバルコンテキストを捉える。
  • X線特徴量ボリュームからのビューごとの平均-最大特徴を取り入れ、ビュー間の整合性を強化する。
  • refined潜在ボリュームをガウスプリミティブへデコードし、微分可能なガウスレンダラーで投影をレンダリングし、その後CTボリュームの3D U-Netによる refinementsを適用する。
  • エンドツーエンドで訓練する際、損失は総合的な損失として、ground-truthへの体積MSE、レンダリングの画像空間L1/SSIM、安定化後の refinement MSE を含む。

実験結果

リサーチクエスチョン

  • RQ1学習済みpriorsとマルチビューX線情報で反復的に精練される明示的な3D潜在ボリュームは、スパースビューCT再構成を向上させられるか。
  • RQ2アーキテクチャの選択(グループクロスアテンション、効率的自己アテンション、ビューごとの集約)は再構成品質と効率にどのような影響を与えるか。
  • RQ3ILVフレームワークは、スパースビュー条件下で高品質なCT再構成と信頼性の高い新規視点X線合成を実現できるか。
  • RQ4学習済み priors はデータセットを越えて一般化し、最適化ベースの手法と比較してほぼリアルタイム性能を実現できるか。

主な発見

  • ILVは6-, 8-, 10ビュー設定で最先端のPSNR/SSIMを達成し、メイン表の10ビューPSNRは33.84 dB、SSIMは0.924。
  • ILVは各ケースを1秒未満で再構成し、3Dの前方伝播および最適化ベースのベースラインを上回りつつほぼリアルタイム性能を提供。
  • 24ビュー以下の設定でもILVはPSNRでR2-Gaussianを約2.6 dB上回り、最速の最適化ベースのベースラインより約400倍高速。
  • クロスデータセット評価では、再訓練なしでFUMPEおよびPENGWINで複数のベースラインよりILVの汎化性能が優れる。
  • アブレーション研究は、反復的なマルチビュー注入と3D U-Net refined が性能に意味のある寄与をすることを示し、全体のILVが最高結果を達成。
  • LPIPSによる知覚的ファインチューニングは、知覚的誤差を低減しつつ高いPSNR/SSIMを維持。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。