[논문 리뷰] CREATIVESUMM: Shared Task on Automatic Summarization for Creative Writing
이 논문은 2022년 COLING에서 개최된 공통 과제인 CreativeSumm을 소개한다. 이 과제는 소설 장편, 영화 대본, 시청률이 높은 TV 드라마 대본, 아침 드라마 대본의 네 분야에 걸쳐 창작 글의 자동 요약을 다룬다. 수집된 데이터셋, 평가 지표, 18개의 제출 결과를 분석하여 복잡한 서사적 구조와 장르 특화된 스타일을 다루는 데서 발생하는 과제를 밝혀내며, ROUGE 점수는 0.29에서 0.39 사이로 나타났고, 신뢰성 및 일관성 지표에서 낮은 성능을 보였다.
This paper introduces the shared task of summarizing documents in several creative domains, namely literary texts, movie scripts, and television scripts. Summarizing these creative documents requires making complex literary interpretations, as well as understanding non-trivial temporal dependencies in texts containing varied styles of plot development and narrative structure. This poses unique challenges and is yet underexplored for text summarization systems. In this shared task, we introduce four sub-tasks and their corresponding datasets, focusing on summarizing books, movie scripts, primetime television scripts, and daytime soap opera scripts. We detail the process of curating these datasets for the task, as well as the metrics used for the evaluation of the submissions. As part of the CREATIVESUMM workshop at COLING 2022, the shared task attracted 18 submissions in total. We discuss the submissions and the baselines for each sub-task in this paper, along with directions for facilitating future work in the field.
연구 동기 및 목표
- 뉴스 및 기술 분야를 초월해 창작 글의 자동 텍스트 요약 연구를 발전시키기 위해.
- 비선형적 플롯 전개와 캐릭터 간 상호의존성을 지닌 장기적이고 복잡한 서사적 구조를 가진 창작 텍스트 요약의 미비한 연구 과제를 해결하기 위해.
- 문학적 소설, 영화 대본, 시청률이 높은 TV, 아침 드라마의 네 가지 다른 창작 장르에 대해 표준화된 데이터셋과 평가 프로토콜을 제공하기 위해.
- 최신 기술 모델을 이러한 새로운 과제에 적용하여 신뢰성, 일관성, 개성 있는 요약 능력에서의 한계를 규명하기 위해.
- 데이터셋 확장과 평가 지표 향상을 통해 향후 연구를 자극하기 위해.
제안 방법
- 기존 데이터셋을 활용해 네 가지 다른 하위 과제를 정제: BookSumm-chapters(프로젝트 구텐베르크 및 학습 가이드에서), Scriptbase(사용자 요약이 포함된 영화 대본), SummScreen(시청률이 높은 TV 및 아침 드라마 대본).
- 데이터셋을 통합하고 필터링하여 겹치는 소설 제목을 제거하고, 신뢰성 낮거나 서사적이지 않은 내용(예: 극본)을 제거.
- ROUGE, LEXICAL, 그리고 사실성 지표(SummaC, LP)를 사용해 평가 프로토콜을 수립하여 사실적 일致성과 내용 커버리지 평가.
- 각 하위 과제에 맞게 미세조정된 LED 및 BART 기반 아키텍처를 포함한 베이스라인 모델 제공, 아블레이션 및 하이퍼파라미터 튜닝 수행.
- 2022년 COLING에서 공통 과제를 주최하여 네 하위 과제에 걸쳐 18개의 제출 결과를 수집하고 비교 분석.
- 재현 가능성과 향후 확장 가능성을 위해 GitHub 저장소를 활용해 데이터, 지침, 평가 스크립트 공유.
실험 결과
연구 질문
- RQ1기존의 순서-에서-순서 모델은 복잡한 서사적 구조를 지닌 장기적 창작 텍스트 요약에 어떻게 성능을 내는가?
- RQ2문학 소설, 영화 대본, 시청률이 높은 TV와 아침 드라마 대본 간 요약 성능의 주요 차이점은 무엇인가?
- RQ3현재 모델은 창작 콘텐츠 요약에서 사실적 일치성과 서사 일관성을 어느 정도 유지하는가?
- RQ4ROUGE, SummaC, LP와 같은 다양한 평가 지표는 창작 텍스트 요약의 품질에 대한 인간 평가와 어느 정도 상관관계가 있는가?
- RQ5비전통적인 논의적 구조를 지닌 창작 텍스트 요약에서 현재 모델의 주요 실패 유형은 무엇인가?
주요 결과
- ROUGE-1 점수는 하위 과제 간 0.29에서 0.39 사이로 변동했으며, 가장 높은 성능은 Scriptbase(영화 대본) 과제에서 기록됨.
- 모든 시스템이 사실성 지표에서 낮은 성능을 보였음: LP 점수는 0.5 이하였고, SummaC 점수는 항상 낮아 사실 일치성이 떨어짐.
- SummScreenFD(아침 드라마) 과제에서 가장 뛰어난 성능을 낸 시스템은 더 짧고 더 추상적인 요약을 생성하여, 장르 특화 요약 전략이 효과적임을 시사함.
- LED 기반 베이스라인은 SummScreenTMS(시청률이 높은 TV)에서 성능이 열악했으며, 반복적이고 추출적인 출력을 생성함. 이는 훈련 최적화 문제로 인한 것으로 보임.
- SummScreenFD와 TMS 간 성능 차이(ROUGE-1 0.29 대비 0.39)는 동일한 도메인 내에서도 데이터 분포의 상당한 차이를 반영함.
- 영화 대본에서 높은 ROUGE 점수를 기록했음에도 불구하고, 시스템은 일관성과 사실 정확성에서 어려움을 겪었으며, 이는 자동 평가 지표와 인간 평가 간 격차가 있음을 시사함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.