Skip to main content
QUICK REVIEW

[논문 리뷰] GameWikiSum: a Novel Large Multi-Document Summarization Dataset

Diego Antognini, Boi Faltings|arXiv (Cornell University)|2020. 02. 17.
Topic Modeling참고 문헌 15인용 수 9
한 줄 요약

이 논문은 전문 비디오 게임 리뷰와 해당 게임의 위키백과 플레이어이드 섹션에서 유래한 14,652개 샘플을 포함하는 대규모 도메인 특화 다중 문서 요약 데이터셋인 GameWikiSum을 소개한다. 이 데이터셋은 추출형 및 개성형 요약 모델의 훈련을 가능하게 하며, C_SKIP 및 SemSentSum과 같은 임bedding 기반 모델이 최신 기술 수준의 성능을 달성함으로써 뉴스 중심 데이터셋을 초월한 다중 문서 요약 기술 발전에 기여할 수 있음을 보여준다.

ABSTRACT

Today's research progress in the field of multi-document summarization is obstructed by the small number of available datasets. Since the acquisition of reference summaries is costly, existing datasets contain only hundreds of samples at most, resulting in heavy reliance on hand-crafted features or necessitating additional, manually annotated data. The lack of large corpora therefore hinders the development of sophisticated models. Additionally, most publicly available multi-document summarization corpora are in the news domain, and no analogous dataset exists in the video game domain. In this paper, we propose GameWikiSum, a new domain-specific dataset for multi-document summarization, which is one hundred times larger than commonly used datasets, and in another domain than news. Input documents consist of long professional video game reviews as well as references of their gameplay sections in Wikipedia pages. We analyze the proposed dataset and show that both abstractive and extractive models can be trained on it. We release GameWikiSum for further research: https://github.com/Diego999/GameWikiSum.

연구 동기 및 목표

  • 뉴스 외의 대규모 비뉴스 다중 문서 요약 데이터셋의 부족 문제를 해결하기 위해 도메인 특화 코퍼스를 구축하기 위해.
  • 고품질의 전문 비디오 게임 리뷰와 위키백과 플레이어이드 섹션을 활용하여 고도화된 추출형 및 개성형 요약 모델의 훈련을 가능하게 하기 위해.
  • 기존 데이터셋이 노이즈가 많은 검색 엔진 결과나 수동 주석에 의존하는 데에 한계가 있음을 고려해, 구조화되고 고품질의 원천 자료를 활용함으로써 이를 극복하기 위해.
  • 미래의 다중 문서 요약 연구를 위한 확장 가능하고 재현 가능하며 공개 가능한 데이터셋을 제공하기 위해.

제안 방법

  • Metacritic에서 265,000개의 전문 비디오 게임 리뷰와 26,000개의 위키백과 플레이어이드 섹션을 크롤링하여 데이터셋을 구축한다.
  • 게임 제목과 구조화된 메타데이터를 활용해 히우리스틱 매칭을 통해 게임 리뷰를 해당 위키백과 페이지와 정렬한다.
  • 위키백과 페이지의 플레이어이드 섹션에서 기준 요약문을 추출하며, 이는 일관되고 표준화된 스타일로 작성되어 있다.
  • 데이터셋은 추출형 및 개성형 요약 모두를 지원하도록 설계되었으며, 입력 문서는 전문 리뷰이고 기준 요약문은 위키백과의 플레이어이드 섹션이다.
  • 표준 ROUGE 메트릭(ROUGE-L, ROUGE-1, ROUGE-2)을 사용해 추출형 및 개성형 접근 방식 간의 성능을 비교 평가한다.
  • 기준 모델로는 TextRank, LexRank, SumBasic, C_SKIP, SemSentSum, Conv2Conv, 그리고 트랜스포머 기반 모델이 포함된다.

실험 결과

연구 질문

  • RQ1전문 비디오 게임 리뷰와 위키백과 플레이어이드 섹션을 활용해 대규모 도메인 특화 다중 문서 요약 데이터셋을 구축할 수 있는가?
  • RQ2GameWikiSum과 같이 비뉴스이면서 고품질의 도메인 특화 데이터셋에서 추출형 및 개성형 요약 모델은 어떻게 성능을 내는가?
  • RQ3임베딩 기반 모델이 이 새로운 데이터셋에서 기존의 빈도 기반 또는 히우리스틱 기반 모델보다 얼마나 뛰어나게 성능을 내는가?
  • RQ4일부 위키백과 기반 코퍼스보다 크기가 작음에도 불구하고, 이 데이터셋은 시퀀스 투 시퀀스 및 트랜스포머 기반 아키텍처와 같은 고도화된 모델의 훈련을 지원할 수 있는가?

주요 결과

  • GameWikiSum은 14,652개의 샘플을 포함하고 있어 일반적으로 사용되는 다중 문서 요약 데이터셋보다 약 100배 더 크다.
  • C_SKIP 및 SemSentSum와 같은 임베딩 기반 모델이 TextRank, LexRank, SumBasic와 같은 전통적 모델보다 뛰어난 성능을 보였다.
  • 개성형 모델인 Conv2Conv는 C_SKIP에 비해 ROUGE-2 점수에서 0.05포인트 뿐 낮게 나타나, 복잡성에도 불구하고 뛰어난 성능을 보였다.
  • 일반 트랜스포머 모델은 Conv2Conv보다 성능이 열등했으며, 언어 모델 버전은 데이터 부족으로 인해 심각하게 성능이 떨어졌다.
  • 결과는 전문 리뷰와 위키백과 플레이어이드 섹션이 의미적으로 일치함을 확인했으며, 이는 데이터셋이 다중 문서 요약에 있어 타당성을 지닌다는 것을 뒷받침한다.
  • 이 데이터셋은 추출형 및 개성형 모델의 훈련을 모두 가능하게 하여, 뉴스 중심 응용 분야를 초월한 분야 발전에 기여할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.