[논문 리뷰] An Implementation of Multimodal Fusion System for Intelligent Digital Human Generation
이 논문은 대규모 언어 모델, 음성 클로닝, 이미지에서 영상으로의 변환 기술을 활용하여 텍스트, 음성, 이미지 입력을 통합하는 다중모달 융합 시스템을 제안한다. 이 시스템은 개인별로 구분되지 않는 방식과 개인별로 맞춤화된 방식의 디지털 인간 구동, 연령 변환, 스타일 전이, 초해상도 기능을 지원하며, 시각적 품질과 사용자 경험에서 최신 기술 수준에 도달하는 고품질 상호작용형 디지털 인간 영상 생성을 가능하게 한다.
With the rapid development of artificial intelligence (AI), digital humans have attracted more and more attention and are expected to achieve a wide range of applications in several industries. Then, most of the existing digital humans still rely on manual modeling by designers, which is a cumbersome process and has a long development cycle. Therefore, facing the rise of digital humans, there is an urgent need for a digital human generation system combined with AI to improve development efficiency. In this paper, an implementation scheme of an intelligent digital human generation system with multimodal fusion is proposed. Specifically, text, speech and image are taken as inputs, and interactive speech is synthesized using large language model (LLM), voiceprint extraction, and text-to-speech conversion techniques. Then the input image is age-transformed and a suitable image is selected as the driving image. Then, the modification and generation of digital human video content is realized by digital human driving, novel view synthesis, and intelligent dressing techniques. Finally, we enhance the user experience through style transfer, super-resolution, and quality evaluation. Experimental results show that the system can effectively realize digital human generation. The related code is released at https://github.com/zyj-2000/CUMT_2D_PhotoSpeaker.
연구 동기 및 목표
- 기존 디지털 인간 제작 방식의 높은 개발 비용과 긴 개발 주기를 해결하기 위해 AI를 활용한 자동화 과정을 도입한다.
- 텍스트, 음성, 이미지 등의 다중모달 입력을 통해 상호작용적이고 개인 맞춤형 디지털 인간 생성을 가능하게 한다.
- 연령 변환, 스타일 전이, 초해상도, 지능형 옷차림 조정을 통해 사용자 경험을 향상시킨다.
- 다양한 응용에 유연하게 대응할 수 있도록 개인별로 구분되지 않는 방식과 개인별로 맞춤화된 방식의 디지털 인간 구동을 모두 지원하는 시스템을 개발한다.
- 포괄적인 이미지 및 영상 품질 평가 지표를 활용하여 시스템의 효과성을 검증한다.
제안 방법
- 사전 처리 단계에서는 대규모 언어 모델(LLM)를 통한 텍스트 이해, 음성 프린트 추출, 음성 생성을 위한 텍스트-to-스피치(TTS) 합성을 수행한다.
- 입력된 이미지는 SAM 모델을 사용하여 연령에 맞는 얼굴 이미지를 생성하기 위해 연령 변환 처리가 이루어진다.
- 개인별로 구분되지 않는(SadTalker) 및 개인별로 맞춤화된(LiveSpeechPortraits) 방식의 구동 기법을 활용하여 디지털 인간 영상 생성을 수행하며, 이 과정에서 얇은 플레이트 스플라인 운동 모델(Thin-Plate-Spline-Motion-Model)을 통한 운동 리타겟팅이 이루어진다.
- 지능형 옷차림 조정은 VITON-HD 모델을 활용하여 생성된 영상 프레임의 의복을 수정한다.
- 후처리 단계로는 DCT-Net을 통한 스타일 전이, BasicVSR++를 활용한 초해상도 처리, 그리고 VSFA, FastVQA, CGIQA, CPBD를 활용한 품질 평가가 수행된다.
- 모든 구성 요소를 통합하여 다중모달 입력에서부터 종단 간 디지털 인간 영상 생성까지의 일관된 파이프라인을 구축한다.
![Figure 1: Classification of digital human. The selected digital humans are from the DDH-QA [ 2 ] and SJTU-H3D [ 3 ] databases.](https://ar5iv.labs.arxiv.org/html/2310.20251/assets/pic/digital_human.png)
실험 결과
연구 질문
- RQ1텍스트, 음성, 이미지 입력에서 고품질 상호작용형 2D 디지털 인간 영상을 효과적으로 생성할 수 있는 다중모달 융합 시스템이 가능한가?
- RQ2시스템은 연령 변환 및 스타일 전이 기능을 통해 개인 맞춤형 디지털 인간을 얼마나 잘 생성하는가?
- RQ3기존 기준과 비교했을 때 생성된 디지털 인간 영상의 시각적 품질과 인지적 품질은 어떠한가?
- RQ4개인별로 구분되지 않는 방식과 개인별로 맞춤화된 방식의 구동 기법을 융합함으로써 얼마나 유연성과 현실감이 향상되는가?
- RQ5초해상도 및 스타일 전이와 같은 후처리 기법이 사용자 경험 향상에 얼마나 효과적인가?
주요 결과
- 시스템은 텍스트, 음성, 이미지 입력에서부터 얼굴 및 전신 애니메이션까지 포함한 현실적인 2D 디지털 인간 영상을 성공적으로 생성하였으며, 그 결과는 그림 3 및 그림 4에서 확인할 수 있다.
- 모든 생성 영상의 평균 CPBD 점수는 0.28 이상을 기록하여 생성된 프레임의 블러가 낮고 선명도가 높음을 나타낸다.
- CGIQA 지표는 모든 테스트 케이스에서 평균 0.57을 기록하여 CG 애니메이션 품질 평가에서 뛰어난 성능을 보였다.
- VSFA 점수는 0.8445에서 0.9893 사이로 변동하였으며, 특히 긴 머리카락을 가진 여성 얼굴의 경우 최고 점수인 0.9893을 기록하여 높은 인지적 영상 품질을 확인하였다.
- FAST-VQA 점수는 항상 0.6 이상을 유지하였으며, 짧은 머리카락 여성 얼굴의 경우 최고 점수 0.8802를 기록하여 강력한 영상 품질 인식 능력을 입증하였다.
- 다양한 입력 조건, 즉 다양한 얼굴 유형, 의복, 음성 입력에 대해 시스템은 뛰어난 일반화 능력을 보이며 안정적인 성능을 발휘하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.