[논문 리뷰] Two Huge Title and Keyword Generation Corpora of Research Articles
이 논문은 오픈 학술 그래프에서 유래한 두 개의 대규모 공개 코퍼스—텍스트 요약을 위한 OAGSX(3400만 건), 키워드 생성을 위한 OAGKX(2300만 건)—를 소개한다. 저자들은 연구 논문 메타데이터를 사전 처리하고, 추출형 및 개괄형 신경망 방법을 사용하여 성능 기준을 수립하여, 더 긴 학습 시간에도 불구하고 개괄형 모델이 추출형 모델보다 뛰어난 성능을 보임을 입증한다.
Recent developments in sequence-to-sequence learning with neural networks have considerably improved the quality of automatically generated text summaries and document keywords, stipulating the need for even bigger training corpora. Metadata of research articles are usually easy to find online and can be used to perform research on various tasks. In this paper, we introduce two huge datasets for text summarization (OAGSX) and keyword generation (OAGKX) research, containing 34 million and 23 million records, respectively. The data were retrieved from the Open Academic Graph which is a network of research profiles and publications. We carefully processed each record and also tried several extractive and abstractive methods of both tasks to create performance baselines for other researchers. We further illustrate the performance of those methods previewing their outputs. In the near future, we would like to apply topic modeling on the two sets to derive subsets of research articles from more specific disciplines.
연구 동기 및 목표
- 신경망 순차-에서-순차 모델을 위한 텍스트 요약 및 키워드 생성 분야에서의 대규모 학습 데이터에 대한 증가하는 수요를 해결하기 위해.
- 연구 논문 메타데이터에서 유래한 두 개의 대규모 고품질 무료 공개 코퍼스를 구축하고 배포하기 위해.
- 데이터의 대표적 서브셋에서 추출형 및 개괄형 방법을 사용하여 성능 기준을 설정하기 위해.
- 완전한 데이터셋에 대한 주제 모델링을 통해 향후 분야별 하위 코퍼스에 대한 집중 연구를 가능하게 하기 위해.
제안 방법
- 오픈 학술 그래프(OAG)에서 대규모 학술 지식 네트워크로 알려진 곳에서 연구 논문의 메타데이터(제목, 초록, 키워드)를 확보하였다.
- 3400만 건의 OAGSX 및 2300만 건의 OAGKX 레코드 전반에 걸쳐 일관성과 품질을 확보하기 위해 철저한 데이터 정제 및 사전 처리를 수행하였다.
- 다양한 추출형 및 개괄형 모델을 평가: TopicRank, RAKE, Maui(감독 추출형), CopyRNN, CovRNN(커버리지 및 복사 기제를 갖춘 개괄형).
- 텍스트 요약에 대해서는 ROUGE 점수, 키워드 생성에 대해서는 F1@k 점수를 사용하여, 코퍼스에서 파생된 미니셋에서의 모델 성능을 비교하였다.
- 개선된 개괄형 키워드 생성을 위해 어텐션, 커버리지, 복사 기제를 갖춘 신경망 순차-에서-순차 모델을 적용하였다.
- 요약, 제목, 키워드 간의 텍스트 길이 및 어휘 유사도를 분석하여 코퍼스의 특성을 규명하였다.
실험 결과
연구 질문
- RQ1대규모 연구 논문 제목 및 키워드 생성 작업에서 추출형 및 개괄형 신경망 모델의 성능는 어떻게 비교되는가?
- RQ2모델 아키텍처와 학습 시간이 생성된 제목 및 키워드의 품질에 어떤 영향을 미치는가?
- RQ3대규모 무료 공개 코퍼스가 연구 논문 메타데이터를 기반으로 한 텍스트 요약 및 키워드 생성 시스템의 성능을 크게 향상시킬 수 있는가?
- RQ4복사 및 커버리지 기제를 갖춘 개괄형 모델이 키워드 생성에서 환각 및 반복을 얼마나 줄일 수 있는가?
- RQ5이 코퍼스에 대한 주제 모델링을 통해 더 집중적인 연구를 위한 도메인 특화 하위 코퍼스를 도출할 수 있는가?
주요 결과
- CopyRNN 및 CovRNN와 같은 개괄형 모델은 추출형 방법보다 유의미하게 높은 F1@7 점수(최고 29.15%)를 기록하여 키워드 생성에서 뛰어난 성능을 보였다.
- 특히 CovRNN은 Maui, TopicRank, RAKE와 같은 모든 추출형 방법보다 OAGKX 벤치마크에서 뛰어난 성능을 보였다.
- 개괄형 모델의 학습은 약 3일이 소요되었고, 반면 추출형 방법은 몇 분 내로 결과를 도출하여 성능과 계산 비용 사이의 상충 관계를 드러냈다.
- 기사당 평균 키워드 수는 5.9개였으며, 이는 F1@7과 F1@10 점수 간 유사성을 설명한다.
- 문법적으로 올바른 것으로 보이지만, 많은 생성된 키워드는 참값 키워드와 부분적 또는 완전한 불일치를 보였고, 일부 모델은 "mortality of rats"와 같은 새로운 그러나 잘못된 어휘 조합을 생성하기도 하였다.
- 저자들이 아는 바에 따르면, OAGSX 및 OAGKX 코퍼스는 연구 논문 제목 및 키워드 생성 작업을 위한 유사한 종류의 가장 큰 무료 공개 데이터셋이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.