[論文レビュー] LookinGood: Enhancing Performance Capture with Real-time Neural Re-Rendering
LookinGood は、パフォーマンスキャプチャパイプラインからの低品質な出力を、深層学習モデルを用いて一括して補完・超解像化・ノイズ除去することで向上させるリアルタイムなニューラル再レンダリングシステムを導入する。自己教師あり損失を用いて意味的顕著性と外れ値の排除に焦点を当てて学習された本手法は、VR/AR向けに高精細で時間的に安定し、ステレオ整合性のあるレンダリングを実現し、ユーザー研究においても生のキャプチャ結果を上回る性能を発揮する。また、訓練済みのデータにない被験者にも一般化可能である。
Motivated by augmented and virtual reality applications such as telepresence, there has been a recent focus in real-time performance capture of humans under motion. However, given the real-time constraint, these systems often suffer from artifacts in geometry and texture such as holes and noise in the final rendering, poor lighting, and low-resolution textures. We take the novel approach to augment such real-time performance capture systems with a deep architecture that takes a rendering from an arbitrary viewpoint, and jointly performs completion, super resolution, and denoising of the imagery in real-time. We call this approach neural (re-)rendering, and our live system "LookinGood". Our deep architecture is trained to produce high resolution and high quality images from a coarse rendering in real-time. First, we propose a self-supervised training method that does not require manual ground-truth annotation. We contribute a specialized reconstruction error that uses semantic information to focus on relevant parts of the subject, e.g. the face. We also introduce a salient reweighing scheme of the loss function that is able to discard outliers. We specifically design the system for virtual and augmented reality headsets where the consistency between the left and right eye plays a crucial role in the final user experience. Finally, we generate temporally stable results by explicitly minimizing the difference between two consecutive frames. We tested the proposed system in two different scenarios: one involving a single RGB-D sensor, and upper body reconstruction of an actor, the second consisting of full body 360 degree capture. Through extensive experimentation, we demonstrate how our system generalizes across unseen sequences and subjects. The supplementary video is available at http://youtu.be/Md3tdAKoLGU.
研究の動機と目的
- AR/VRアプリケーションにおけるリアルタイムパフォーマンスキャプチャの視覚的アーティファクト(穴、ノイズ、低解像度、照明の悪さ)を是正すること。
- 手動アノテーションを必要とせず、3D再構築から得られる粗い2Dレンダリングを高品質な出力に向上させるリアルタイムなニューラル再レンダリングシステムを開発すること。
- 特にバイノキュラーレンダリングにおいて最適なVR/AR体験を実現するため、時間的安定性とステレオ整合性を確保すること。
- 意味的認識損失関数を用いた自己教師あり学習により、訓練データに含まれない被験者やシーケンスに対しても一般化できるようにすること。
提案手法
- 低解像度でアーティファクトを含む2Dレンダリングを、リアルタイムで高品質・高解像度の出力にマッピングする深層ニューラルネットワークを学習する。
- 教師なし学習アプローチを採用し、再構築損失に意味的監視を組み合わせることで、教師データのアノテーションを不要にする。
- 損失関数内での顕著性に基づく再重み付け機構により、顔など重要な領域を強調し、外れ値の影響を低減する。
- モデル量子化(16ビット浮動小数点)と効率的なアーキテクチャ設計により、リアルタイム推論を最適化し、NVIDIA Titan V で1ステレオペアあたり29msの処理を達成する。
- 予測された再レンダリング出力のフレーム間差分を最小化することで、時間的安定性を強制する。
- テスト時にも、被験者を背景から分離するバイナリセグメンテーションマスクを予測する。
実験結果
リサーチクエスチョン
- RQ1教師なし学習により、手動アノテーションを一切不要としつつ、低品質なリアルタイムパフォーマンスキャプチャ出力を効果的に向上できるか?
- RQ2損失関数に意味的情報を統合することで、顔など重要な領域の視覚的品質をどのように向上させられるか?
- RQ3VR/ARアプリケーションにおいて、ニューラル再レンダリングシステムがどの程度の時間的安定性とステレオ整合性を達成できるか?
- RQ4訓練データに含まれない被験者やシーケンスに対しても、本システムはどの程度一般化できるか?
主な発見
- 1枚のGPUで1ステレオペアあたり29msのリアルタイム処理を達成し、VR/ARアプリケーションの要件を満たしている。
- ユーザー研究において、65%の参加者がニューラル再レンダリング出力を、地面の真値よりも好むと回答した。これは、やや解像度が低くてもマスクの安定性が優れていると評価されたためである。
- 訓練済みデータにない被験者やシーケンスに対しても、良好な一般化性能を示し、極度に損傷の激しい入力では僅かな劣化を示すにとどまる。
- 顕著性再重み付けを施した自己教師あり損失により、顔の品質が著しく向上し、外れ値の影響も顕著に低減された。
- フレーム間の再レンダリング出力の変動を最小化することで、時間的に安定した結果が得られた。
- 入力が著しく損傷している場合には、モデルがぼやけた結果を「幻覚」的に生成する傾向があることが判明し、極端な状況下での主な制限要因であると判明した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。