[논문 리뷰] Visual Story Generation Based on Emotion and Keywords
이 논문은 사용자가 지정한 키워드와 감정 레이블을 기반으로 일관되고 감정적으로 일관된 스토리를 생성하는 상호작용형 뷰어블 스토리 공동창작 파이프라인을 제안한다. 감정 예측을 위한 미세튜닝된 BERT와 조건부 스토리 생성을 위한 T5를 결합하고, 영상 합성에 확산 모델을, 객체 인식에 YOLOv5와 Faster R-CNN을 활용하여 반복적인 키워드 확장을 가능하게 하여 기준 모델 대비 평균 BLEU 점수 62% 향상 달성.
Automated visual story generation aims to produce stories with corresponding illustrations that exhibit coherence, progression, and adherence to characters' emotional development. This work proposes a story generation pipeline to co-create visual stories with the users. The pipeline allows the user to control events and emotions on the generated content. The pipeline includes two parts: narrative and image generation. For narrative generation, the system generates the next sentence using user-specified keywords and emotion labels. For image generation, diffusion models are used to create a visually appealing image corresponding to each generated sentence. Further, object recognition is applied to the generated images to allow objects in these images to be mentioned in future story development.
연구 동기 및 목표
- 사용자가 감정 톤과 스토리의 핵심 요소를 제어할 수 있는 상호작용형 뷰어블 스토리 공동창작 시스템을 개발하는 것.
- 감정과 키워드 제약 조건을 통합하여 자동화된 뷰어블 스토리텔링에서 서사의 일관성과 논리적 흐름을 향상시키는 것.
- 객체 인식을 통해 생성된 영상에서 새로운 키워드를 추출하여 반복적인 스토리 개발을 가능하게 하는 것.
- 여러 개의 NLP 메트릭을 사용하여 감정과 키워드 프롬프팅이 스토리 생성 품질에 미치는 영향을 평가하는 것.
- 사용자 참여를 수반하는 스토리와 시각 자료의 반복적 개선을 지원하는 완전한 텍스트-이미지 파이프라인을 구축하는 것.
제안 방법
- 이전 서사적 맥락을 바탕으로 다음 스토리 문장의 감정 레이블을 예측하기 위해 미세튜닝된 BERT${}_{\textsc{Next Emo}}$ 사용.
- 사용자가 제공한 키워드와 감정 레이블을 조건으로 다음 문장을 생성하기 위해 T5${}_{\textsc{BASE Fine-tuned CommonGen}}$를 미세튜닝.
- 각 생성된 문장에 해당하는 영상을 생성하기 위해 확산 모델(예: Disco Diffusion) 활용.
- 생성된 영상에서 객체 인식을 위해 YOLOv5와 Faster R-CNN 적용하여 향후 스토리 개발을 위한 새로운 키워드 추출.
- 추출된 객체를 다음 스토리 단계에서 제안된 키워드로 사용하는 피드백 루프 통합.
- 고정 템플릿을 사용한 프롬프트 엔지니어링을 통해 T5 모델의 입력 형식을 일관되게 유지하고 추론 과정에서의 일관성 확보.

실험 결과
연구 질문
- RQ1사용자가 지정한 감정과 키워드가 생성된 스토리의 일관성과 논리적 일관성에 상당한 영향을 미치는가?
- RQ2맥락만을 기반으로 한 기준 모델 대비 감정과 키워드 프롬프팅 통합이 서사 생성 품질에 어떤 영향을 미치는가?
- RQ3생성된 영상에서의 객체 인식이 반복적이고 진화하는 스토리 개발을 얼마나 잘 지원하는가?
- RQ4플루치크 감정 휠 기반 감정 예측 모델이 스토리 생성 맥락에서 어떻게 성능을 발휘하는가?
- RQ5다중모달 피드백(텍스트, 감정, 이미지, 객체 인식)이 뷰어블 스토리텔링의 총합 품질에 어떤 영향을 미치는가?
주요 결과
- 제안된 파이프라인은 기준 모델 대비 평균 BLEU 점수 62% 향상 달성.
- BERT 점수 0점 샘플 수가 크게 감소하여 인간이 작성한 서사와의 일치도 향상됨.
- 평균 BERT 점수 6.7% 상승으로 생성된 스토리의 의미적 품질과 일관성 향상됨.
- 점수 변동성이 감소하여 더 안정적이고 신뢰할 수 있는 생성 성능을 보임.
- 생성된 영상에서의 객체 인식을 통해 새로운 키워드를 성공적으로 추출하여 반복적이고 진화하는 스토리 개발이 가능해짐.
- 감정 예측 모델(BERT${}_{\textsc{Next Emo}}$)은 매크로 AUC-ROC 점수 0.78 달성하여 감정 인식 기반 스토리텔링의 유용성을 확인함.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.