[논문 리뷰] Generating coherent comic with rich story using ChatGPT and Stable Diffusion
이 논문은 GPT-4와 미세조정된 Stable Diffusion를 사용하여 일관되고 스토리가 풍부한 만화를 생성하는 방법을 제시한다. 프롬프트 엔지니어링과 LoRA 기반 미세조정을 통해 캐릭터의 일관성과 예술 스타일을 유지한다. 전체 미세조정 시퀀스 후, SSIM 및 FID 지표에서 Midjourney V5를 능가하는 최신 기술 성능(SOTA)을 달성한다.
Past work demonstrated that using neural networks, we can extend unfinished music pieces while maintaining the music style of the musician. With recent advancements in large language models and diffusion models, we are now capable of generating comics with an interesting storyline while maintaining the art style of the artist. In this paper, we used ChatGPT to generate storylines and dialogue and then generated the comic using stable diffusion. We introduced a novel way to evaluate AI-generated stories, and we achieved SOTA performance on character fidelity and art style by fine-tuning stable diffusion using LoRA, ControlNet, etc.
연구 동기 및 목표
- 대규모 언어 모델과 확산 모델을 사용하여 일관되고 스토리가 풍부한 만화를 생성하는 파이프라인을 개발한다.
- 미세조정된 Stable Diffusion를 사용하여 특정 만화 캐릭터(예: 원피스)의 캐릭터 생성 일관성을 향상시킨다.
- 목표 만화(예: 원피스) 및 인기 있는 만화(나루토, 블리치 등)의 스토리 유사성을 기반으로 AI 생성 만화 내러티브 평가를 위한 새로운 스토리 스코어 지표를 제안한다.
- 안정적인 확산 모델을 위해 LoRA, ControlNet, CFG 스케줄링의 미세조정 단계 순서를 평가하고 최적화한다.
- SSIM 및 FID 지표를 사용해 Midjourney V5와 같은 상용 모델과의 성능을 비교한다.
제안 방법
- GPT-4와 GPT-3.5를 사용하여 한 페이지에 6개의 패널을 포함한 만화를 생성하며, 캐릭터 대화와 장면 묘사를 포함한 프롬프트를 사용한다. 프롬프트는 오직 원피스 캐릭터(Luffy, Zoro, Nami)만을 지정한다.
- One Piece 위키에서 사전에 프롬프트된 캐릭터 생애사 정보를 제공하여 내러티브 일관성을 향상시킨다.
- BERT 기반 문장 임베딩과 코사인 유사도를 사용하여 목표 만화(원피스)와 인기 있는 만화(나루토, 블리치 등)의 스토리 유사성을 통합한 스토리 스코어 지표를 제안한다.
- LoRA 가중치를 사용하여 원피스 캐릭터(라이콘의 와노 사가 LoRA)를 사전에 미세조정한 Stable Diffusion를 사용하여 정확한 캐릭터 생성을 가능하게 한다.
- 다단계 미세조정 파이프라인을 적용: LoRA 적용, CFG 스케일 조정, 샘플링 스텝 최적화, Canny 자세 추정을 사용한 ControlNet 적용으로 일관된 캐릭터 자세 유지를 도모한다.
- Roronoa Zoro의 대상 이미지 배치와 비교하여 생성된 출력물의 이미지 품질을 SSIM 및 FID 지표로 평가한다.

실험 결과
연구 질문
- RQ1특정 만화 캐릭터 제약 조건을 가진 프롬프트를 사용할 때, GPT-4와 GPT-3.5는 일관된 캐릭터 표현을 갖춘 일관되고 내러티브가 풍부한 만화 페이지를 생성할 수 있는가?
- RQ2LLM에 추가적인 캐릭터 생애사 지식을 제공하면 생성된 만화 스토리의 품질과 일관성이 향상되는가?
- RQ3LoRA와 ControlNet을 사용한 미세조정된 Stable Diffusion 모델은 Midjourney V5와 같은 상용 모델보다 캐릭터 일관성과 시각적 일관성에서 뛰어나게 성능을 낼 수 있는가?
- RQ4제안된 스토리 스코어 지표는 AI 생성 만화의 내러티브 품질과 독창성을 효과적으로 캡처하는가?
- RQ5LoRA, CFG, 샘플링 스텝, ControlNet의 순서를 어떻게 설정하면 캐릭터 생성의 최적의 시각적 품질을 달성할 수 있는가?
주요 결과
- 캐릭터 생애사 프롬프트를 사용한 GPT-4는 가장 높은 스토리 스코어(0.62)를 기록했지만, GPT-3.5와의 성능 향상은 미미했으며, GPT-3.5는 프롬프트 없이 0.60의 점수를 기록했다.
- 스토리 스코어 지표는 내러티브 일관성을 효과적으로 캡처했으며, 높은 점수는 인간 평가에서의 내러티브 품질과 스토리 관련성과 상관관계를 보였다.
- Midjourney V5는 초기에 기준 모델 전부를 압도했지만, 전체 미세조정 후 제안된 방법이 SSIM 및 FID 지표에서 모두 Midjourney V5를 능가했다.
- 전체 미세조정 파이프라인—LoRA, CFG 조정, 샘플링 스텝 최적화, Canny 자세를 사용한 ControlNet—은 일관되고 고해상도의 캐릭터 생성을 가능하게 했으며, 시각적 품질이 단계별로 향상되었다.
- BERT 기반 문장 임베딩을 사용한 스토리 유사도 계산은 인간 평가를 통해 검증된 계산 효율성과 효과성을 보였다.
- 최종 만화 생성 파이프라인은 내러티브 연속성이 확보된 일관되고 시각적으로 일관된 만화 페이지를 성공적으로 생성했으며, 종단 간 AI 만화 제작의 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.