Skip to main content
QUICK REVIEW

[논문 리뷰] Replication Markets: Results, Lessons, Challenges and Opportunities in AI Replication

Yang Liu, Michael Gordon|arXiv (Cornell University)|2020. 05. 10.
Explainable Artificial Intelligence (XAI)참고 문헌 27인용 수 5
한 줄 요약

이 논문은 인간의 복제 결과 예측을 활용하여 AI 및 머신러닝 연구의 복제 가능성 평가를 가용성 있게 하는 복제 시장 복제 시장이라는 방법을 제안한다. 실제 결과가 없이도 예측 정확도를 추정할 수 있는 대체 스코어링을 사용함으로써 전문가 순위 매기기, 높은 영향력의 복제 작업 우선순위 정하기, 매월 수상자에게 보상 주기 등을 통해 더 나은 재현 가능성 확보를 유도한다. 검증 과정에서 대체 스코어링과 실제 성능 간 강한 상관관계가 관찰되었다.

ABSTRACT

The last decade saw the emergence of systematic large-scale replication projects in the social and behavioral sciences, (Camerer et al., 2016, 2018; Ebersole et al., 2016; Klein et al., 2014, 2018; Collaboration, 2015). These projects were driven by theoretical and conceptual concerns about a high fraction of "false positives" in the scientific publications (Ioannidis, 2005) (and a high prevalence of "questionable research practices" (Simmons, Nelson, and Simonsohn, 2011). Concerns about the credibility of research findings are not unique to the behavioral and social sciences; within Computer Science, Artificial Intelligence (AI) and Machine Learning (ML) are areas of particular concern (Lucic et al., 2018; Freire, Bonnet, and Shasha, 2012; Gundersen and Kjensmo, 2018; Henderson et al., 2018). Given the pioneering role of the behavioral and social sciences in the promotion of novel methodologies to improve the credibility of research, it is a promising approach to analyze the lessons learned from this field and adjust strategies for Computer Science, AI and ML In this paper, we review approaches used in the behavioral and social sciences and in the DARPA SCORE project. We particularly focus on the role of human forecasting of replication outcomes, and how forecasting can leverage the information gained from relatively labor and resource-intensive replications. We will discuss opportunities and challenges of using these approaches to monitor and improve the credibility of research areas in Computer Science, AI, and ML.

연구 동기 및 목표

  • 사회과학 분야의 '복제 위기'에 영향을 받아 AI 및 머신러닝 분야에서 재현 불가능한 결과에 대한 우려가 증가하고 있는 데 대응하기 위해.
  • AI 연구 주장의 복제 가능성에 대해 예측 가능한, 시장 기반의 확장 가능한 메커니즘 개발을 위해.
  • 실제 결과가 없는 상황에서도 예측 품질을 추정하기 위해 대체 스코어링을 사용하기 위해.
  • 매월 수상자와 랭킹 보드를 통해 고품질 예측을 유도하기 위해.
  • 전문가 예측 기반으로 복제 작업 우선순위를 정름으로써 연구의 신뢰성 향상시키기 위해.

제안 방법

  • AI/ML 주장의 복제 성공 여부에 대한 예측을 수집하기 위해 예측 시장과 설문 조사를 활용한다.
  • 실제 결과 없이 참가자 예측만을 사용하여 예측 정확도를 추정하기 위해 대체 스코어링 규칙(SSF)을 적용한다.
  • 예측 품질의 기준으로 브리어 스코어를 사용하며, SSR은 예측 수가 증가함에 따라 진짜 브리어 스코어로 수렴하도록 설계되어 있다.
  • 참가자들을 SSR 스코어로 순위 매기어 최고의 예측자 식별하고 매월 수상자로 선정한다.
  • 실험 데이터에서 대체 스코어링 성능을 실제 브리어 스코어와 비교하여 검증한다.
  • SSR 가중 평균을 사용해 전문가의 일치도를 반영하고 신뢰도가 추정된 집단 복제 가능성 스코어(CS)를 구성한다.

실험 결과

연구 질문

  • RQ1인간의 복제 결과 예측이 AI 및 머신러닝 연구의 성공 여부를 신뢰성 있게 예측할 수 있는가?
  • RQ2실제 결과에 접근할 수 없는 상황에서도 대체 스코어링 기법이 예측 품질을 정확히 추정할 수 있는가?
  • RQ3매월 수상자와 랭킹 보드가 장기 예측 과제에서 참가자의 참여를 유지하는 데 얼마나 효과적인가?
  • RQ4SSR 기반 집계가 실제 복제 결과와 얼마나 높은 상관관계를 보이는가?
  • RQ5예측 기반 우선순위 정하기가 대규모 복제 노력의 비용을 줄이고 영향력을 높일 수 있는가?

주요 결과

  • 대체 스코어링(SSF)은 기대치상 브리어 스코어를 성공적으로 복원하여 실제 결과 없이도 예측 정확도 평가가 가능하다.
  • 실험 데이터에서 SSR로 추정한 스코어와 실제 브리어 스코어 사이에 강한 상관관계가 관찰되어 방법의 정확도가 검증되었다.
  • 매월 수상자 보상 제도는 참가자의 참여를 크게 증가시키며 장기적 참여 유지에 효과적이었다.
  • SSR을 통해 식별된 최고의 예측자들은 참가자들 사이에서 일관되게 인정받았으며, 블로그와 소셜 미디어에서 공개적으로 칭찬받았다.
  • SSR 가중 평균 집계는 마켓 기반 결과와 높은 일관성을 보이며, 강건성과 정보성의 잠재력을 입증했다.
  • 이 방법은 높은 신뢰도를 가진 주장들을 식별함으로써 복제 작업의 확장 가능하고 비용 효율적인 우선순위 정하기를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.