[논문 리뷰] Plan, Write, and Revise: an Interactive System for Open-Domain Story Generation
이 논문은 계획, 작성, 수정 단계에서 다수의 단계에서 인간과의 협업을 가능하게 하는 인터랙티브 신경망 스토리 생성 시스템을 제시한다. 이는 다수의 인간-중심 상호작용 수준이 덜 인터랙티브한 기준 대비 스토리 품질을 10–50% 향상시키며, 사용자 참여도를 높이고 창의성, 일관성, 다양성 향상에 특화된 개선을 가능하게 한다.
Story composition is a challenging problem for machines and even for humans. We present a neural narrative generation system that interacts with humans to generate stories. Our system has different levels of human interaction, which enables us to understand at what stage of story-writing human collaboration is most productive, both to improving story quality and human engagement in the writing process. We compare different varieties of interaction in story-writing, story-planning, and diversity controls under time constraints, and show that increased types of human collaboration at both planning and writing stages results in a 10-50% improvement in story quality as compared to less interactive baselines. We also show an accompanying increase in user engagement and satisfaction with stories as compared to our own less interactive systems and to previous turn-taking approaches to interaction. Finally, we find that humans tasked with collaboratively improving a particular characteristic of a story are in fact able to do so, which has implications for future uses of human-in-the-loop systems.
연구 동기 및 목표
- 계획, 작성, 수정 단계에서 인간 상호작용의 다양한 수준이 오픈 도메인 스토리 생성에서 스토리 품질과 사용자 참여도에 미치는 영향을 조사하는 것.
- 이전 시스템이 스토리 계획, 신선함 제어, 반복적 수정에 대한 사용자 참여 부족이라는 한계를 해결하는 것.
- 사용자가 창의성, 인과적-시간적 일관성, 관련성과 같은 특정 스토리 품질을 향상시키기 위해 시스템을 효과적으로 이끌 수 있는지 평가하는 것.
- 교차 대화 기반 시스템과 대비하여 시간 제약 조건 하에서 다양한 상호작용 유형의 영향을 평가하는 것.
제안 방법
- 시스템은 사용자 중심의 스토리 생성을 위한 두 가지 상호작용 모드를 사용한다: 크로스-모델(세 개의 신경망 스토리 모델 간 비교)과 인트라-모델(단일 선택된 모델과 협업)이다.
- 사용자는 주제 제공, 디코딩 온도 조절(다양성 제어), 스토리라인 공동 창작, 문장 편집, 이전 내용의 반복적 수정을 통해 이후 생성에 영향을 줄 수 있다.
- 스토리라인 플래너는 요아오 등(2019)의 방법을 변형하여 어휘 기반 스토리 초안을 생성하며, 이는 스토리 라이터가 전체 스토리를 생성하는 데 사용된다.
- 시스템은 비선형적이고 융통성 있는 상호작용을 지원한다: 사용자는 언제든지 계획이나 텍스트를 수정할 수 있으며, 이후 내용이 실시간으로 업데이트된다.
- 다양성은 소프트맥스 온도 설정을 통해 제어되며, 사용자 입력은 spaCy 토크나이저 및 Moses 디토크나이저를 통해 모델 출력과 호환되도록 처리된다.
- 판별기의 앙상블이 창의성, 관련성, 인과적-시간적 일관성, 총합 품질 등의 지표를 바탕으로 스토리 품질을 평가한다.
실험 결과
연구 질문
- RQ1스토리 생성의 어느 단계(계획, 작성, 수정)에서 인간 협업이 스토리 품질 향상에 가장 효과적인가?
- RQ2계획, 편집, 다양성 제어, 수정 등의 다수 수준의 인간 상호작용이 교차 대화 기반 또는 단일 단계 상호작용 대비 스토리 품질과 사용자 만족도에 어떤 영향을 미치는가?
- RQ3사용자가 시스템과의 목표 지향적 협업을 통해 창의성, 일관성 등의 특정 스토리 품질을 효과적으로 향상시킬 수 있는가?
- RQ4사용자가 스토리 품질을 어떻게 평가하는지가 다양한 상호작용 조건에서 독립적인 인간 평가와 얼마나 일치하는가?
- RQ5이전 수정 사항이 이후 콘텐츠에 영향을 미치는 반복적 수정이 스토리 일관성과 창의성 향상에 측정 가능한 영향을 미치는가?
주요 결과
- 계획, 작성, 수정 단계에서 인간 상호작용을 늘일수록 덜 인터랙티브한 기준 대비 스토리 품질이 10–50% 향상되었다.
- 스토리 오직 조건(생성된 문장을 집중적으로 편집하는 조건)은 창의성과 인과적-시간적 일관성에서 가장 높은 독립 평가 점수를 기록했지만, 사용자가 보고한 품질 점수는 낮았다.
- 인터랙티브 시스템은 비인터랙티브 기준 및 교차 대화 기반 시스템 대비 사용자 참여도와 만족도가 유의미하게 높았다.
- 창의성, 관련성 등의 특정 스토리 품질을 향한 목표 지향적 협업은 해당 지표에서 측정 가능한 향상을 이끌었으며, All+ 실험은 모든 차원에서 All 실험을 능가했고, 관련성 제외 전반적으로 뛰어났다.
- 교차 대화 기준은 관련성에서는 유사한 성능을 보였지만 창의성과 일관성에서 열등했으며, 이는 국소적 편집만으로는 전반적인 스토리 품질 향상이 부족함을 시사한다.
- 사용자가 보고한 품질 점수는 독립 평가와 잘 일치하지 않았으며, 특히 스토리 오직 조건에서 이격이 두드러졌다. 이는 주관적 품질과 객관적 품질 간 괴리가 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.