Skip to main content
QUICK REVIEW

[논문 리뷰] Ranking academic institutions on potential paper acceptance in upcoming conferences

Jobin Wilson, Ram Mohan|arXiv (Cornell University)|2016. 10. 10.
Big Data and Business Intelligence참고 문헌 15인용 수 5
한 줄 요약

이 논문은 최고 수준의 컨퍼런스에서의 기대 논문 수용를 기반으로 연구 기관 순위를 예측하기 위해 이단계 방법을 제안한다. ACM 디지털 라이브러리와 마이크로소프트 애카데믹 그래프에서 웹 크롤링한 데이터를 사용하여 전문 논문를 식별하고, 지수 평활 모델을 적용하여 수용 추세를 예측한다. KDD 컵 2016에서 전체 NDCG@20 점수는 0.7508을 기록하였다.

ABSTRACT

The crux of the problem in KDD Cup 2016 involves developing data mining techniques to rank research institutions based on publications. Rank importance of research institutions are derived from predictions on the number of full research papers that would potentially get accepted in upcoming top-tier conferences, utilizing public information on the web. This paper describes our solution to KDD Cup 2016. We used a two step approach in which we first identify full research papers corresponding to each conference of interest and then train two variants of exponential smoothing models to make predictions. Our solution achieves an overall score of 0.7508, while the winning submission scored 0.7656 in the overall results.

연구 동기 및 목표

  • 향후 최고 수준의 컨퍼런스에서 전체 연구 논문의 수용 예측을 바탕으로 학술 기관을 순위 매기는 것.
  • 공개된 웹 데이터만을 사용하여 향후 논문 수용을 추정하는 과제를 해결하는 것.
  • 다양한 컨퍼런스의 동적 변화와 출판 패턴에 일반화 가능한 강력한 예측 파이프라인을 개발하는 것.
  • 반자동 논문 분류와 시계열 모델링을 융합하여 예측 정확도를 향상시키는 것.

제안 방법

  • 목표 컨퍼런스의 논문 메타데이터와 섹션 정보를 ACM 디지털 라이브러리 프로ceedings에서 웹 크롤러를 활용해 추출하였다.
  • 수동 규칙 기반 필터링과 분류 모델을 결합한 반자동 접근 방식을 사용하여, 모든 수용된 논문 중에서 전체 연구 논문를 식별하였다.
  • 소속 기관별 관련도 점수(rel scores)의 시계열을 구성하였으며, 이는 소속 기관별 수용된 논문 비율에 기반하였다.
  • 각 컨퍼런스의 향후 rel 점수를 예측하기 위해 지수 평활 모델과 ARIMA 모델을 적용하였다.
  • 지수 평활 모델의 스무딩 파라미터 α를 최적화하기 위해 그리드 서치를 수행하였으며, 최적 값은 각각 ACM MM에 대해 0.4, FSE에 대해 0.2, MobiComm에 대해 0.35였다.
  • 모델과 파라미터를 선택하기 위해 NDCG@20를 평가 지표로 사용하는 교차 검증 프레임워크를 구현하였다.

실험 결과

연구 질문

  • RQ1공개된 데이터 소스를 활용해 컨퍼런스 프로ceedings에서 전체 연구 논문를 신뢰성 있게 식별할 수 있는 방법은 무엇인가?
  • RQ2다양한 컨퍼런스의 동적 변화와 변동성이 큰 출판 추세를 고려할 때, 어떤 시계열 예측 모델이 가장 우수한 성능을 보이는가?
  • RQ3지수 평활 모델이 ARIMA와 같은 더 복잡한 모델보다 학술 기관의 향후 논문 수용률을 예측하는 데 더 뛰어난가?
  • RQ4NDCG@20를 평가 지표로 사용하는 교차 검증 프레임워크는 순위 예측의 실제 성능을 추정하는 데 얼마나 효과적인가?

주요 결과

  • α = 0.4로 설정된 지수 평활 모델이 ACM MM에 대해 평균 교차 검증 NDCG@20 점수 0.7294를 기록하여 최고 성능을 보였다.
  • ACM MM에 대해 실제 Phase 3 점수는 0.7334로 나타나, 미리 보지 않은 데이터에 대한 강력한 일반화 능력을 확인하였다.
  • Phase 2 결과에서는 모델의 일반화 능력이 뛰어났으며, 교차 검증 점수는 0.8086, 실제 점수는 0.8075를 기록하였다.
  • ARIMA 모델은 특히 Phase 3에서 rel 점수 시계열의 고도로 변동성이 높아 성능이 열악하였다.
  • 반자동 논문 식별 파이프라인은 순수 규칙 기반 방법에 비해 거짓 긍정률을 감소시켜 데이터 품질을 향상시켰다.
  • 최종 솔루션은 전체 NDCG@20 점수 0.7508을 기록하여 1위 제출물(0.7656)에 이어 2위를 차지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.