[논문 리뷰] S2ORC: The Semantic Scholar Open Research Corpus
S2ORC는 다양한 출판사와 아카이브에서 유래한 구조화된 전체 논문, 메타데이터, 참고문헌을 통합하여 8,110만 건의 영문 학술 논문으로 구성된 가장 큰 공개 가능하고 기계로 읽을 수 있는 코퍼스를 제공한다. 이는 연결된 인용문, 그림, 표, 수식을 포함한 풍부하게 주석 처리된 전체 논문 데이터를 통해 고도로 구조화된 컨텐츠를 제공함으로써 이전의 코퍼스보다 훨씬 넓은 커버리지와 더 높은 구조적 품질을 확보한다.
We introduce S2ORC, a large corpus of 81.1M English-language academic papers spanning many academic disciplines. The corpus consists of rich metadata, paper abstracts, resolved bibliographic references, as well as structured full text for 8.1M open access papers. Full text is annotated with automatically-detected inline mentions of citations, figures, and tables, each linked to their corresponding paper objects. In S2ORC, we aggregate papers from hundreds of academic publishers and digital archives into a unified source, and create the largest publicly-available collection of machine-readable academic text to date. We hope this resource will facilitate research and development of tools and tasks for text mining over academic text.
연구 동기 및 목표
- 다양한 학문 분야를 아우르는 가장 큰 공개 가능하고 기계로 읽을 수 있는 학술 논문 코퍼스를 구축하기 위해.
- 수백 개의 출판사와 아카이브에서 온 전체 논문을 하나의 일관되고 접근 가능한 자원으로 통합하고 통합하기 위해.
- 기존의 인용문, 그림/표 참조, 연결된 참고문헌 메타데이터와 함께 정제된 주석 처리된 전체 논문을 제공하여 NLP 및 텍스트 마이닝 응용 프로그램의 성능을 향상시키기 위해.
- 전체 논문 파싱, 인용 연결, 다양한 학문 분야 지원을 통해 기존 학술 텍스트 코퍼스의 품질과 커버리지 향상시키기 위해.
제안 방법
- 신뢰할 수 있는 출판사, 디지털 아카이브(예: arXiv, PubMed Central), 기관 리포지터리에서 유래한 8,110만 건의 영문 학술 논문을 수집하였다.
- Grobid와 pdfalto를 사용하여 810만 건의 오픈 액세스 PDF에서 전체 논문을 추출하고 구조화하여 ¶문단 구분, 섹션 헤더, 인라인 주석을 유지하였다.
- 자동으로 인라인 인용문, 그림 참조, 표 참조, 수식을 해당 참고문헌 항목 및 객체로 연결하였다.
- Semantic Scholar 문헌 그래프 내 8,110만 개의 논문 노드에 모든 인용문을 연결하여 통합된 인용 그래프를 생성하였다.
- 추가적인 구조적 요소(예: 수학 공식, 표 내용)를 복구하기 위해 별도의 LaTeX 파싱된 서브셋(150만 건의 논문)을 제공하였다.
- 처리 이전에 낮은 품질 또는 논문이 아닌 PDF(예: 50页 초과, 슬라이드, 파싱 오류)를 제외하기 위해 필터링 히ュ리스틱을 적용하였다.
실험 결과
연구 질문
- RQ1다양한 출처에서 일관된 구조와 메타데이터를 갖춘 대규모, 통합된, 기계로 읽을 수 있는 학술 논문 코퍼스를 어떻게 구성할 수 있는가?
- RQ2S2ORC는 전체 논문 커버리지, 구조적 풍부성, 다학문적 다양성 측면에서 기존 코퍼스보다 어느 정도 뛰어나게 되는가?
- RQ3연결된 인용문, 그림, 표를 포함한 정제된 전체 논문을 포함함으로써, 인용 연결 또는 논의 분석과 같은 후행 NLP 작업의 성능이 상당히 향상되는가?
- RQ4원본 논문 클러스터링 방법이 프리프린트판과 출판판 간에 논문의 의도된 정체성을 얼마나 잘 유지하는가?
- RQ5S2ORC를 기반으로 BERT 모델을 미리 학습시킬 경우, 다른 사전학습 코퍼스 대비 학술 NLP 작업에서 어떤 영향을 미치는가?
주요 결과
- S2ORC는 8,110만 개의 논문 노드를 포함하며, 그 중 810만 개의 논문은 PDF에서 전체 논문 내용을 추출하고 구조화하였다.
- S2ORC는 컴퓨터 과학, 물리학, 수학, 생물의학 문헌을 포함하여 다른 어떤 공개 가능한 코퍼스보다 더 넓은 학문 분야를 커버한다.
- S2ORC는 인라인 인용문, 그림 및 표 참조를 해당 객체 및 참고문헌 항목에 연결한 전체 논문 파싱을 제공한다.
- LaTeX 파싱된 서브셋(150만 건의 논문)은 수식 및 표 내용과 같은 추가적인 구조적 요소를 복구하여 Saier와 Färber(2019)의 이전 코퍼스보다 향상된 성능을 보였다.
- S2ORC는 PubMed Central(OA)보다 세 배 이상 많은 전체 논문을 포함하고 있으며, 다음으로 큰 코퍼스이자 문헌학적 특성 강화 기능을 갖춘 코퍼스이다.
- 평가 결과, 원본 제목의 98.5%와 저자 목록의 97.2%가 허용 가능한 변형(예: 대소문자, 특수문자, 약어) 내에서 PDF와 일치함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.