Skip to main content
QUICK REVIEW

[논문 리뷰] Replicating and Scaling up Qualitative Analysis using Crowdsourcing: A Github-based Case Study

Di Chen, Kathryn T. Stolee|arXiv (Cornell University)|2017. 02. 27.
Mobile Crowdsensing and Crowdsourcing참고 문헌 39인용 수 7
한 줄 요약

이 논문은 GitHub 풀 리퀘스트 수락에 대한 정성적 연구를 복제하고 확장하기 위해 공동 작업을 활용하는 확장 가능한 보조 연구 프레임워크(MOSSS)를 제안한다. 20개의 풀 리퀘스트에서 유도된 정성적 통찰을 공동 작업 가능한 질문으로 변환하여 250개의 풀 리퀘스트를 분석함으로써, 공동 작업 기반 특징을 사용하여 머지 결과를 예측할 때 중앙값 F₁ 점수 68%를 달성하였으며, 정량적 특징과 조합할 경우 90%로 향상되어, 경험적 소프트웨어 공학 연구에서 방법론 통합의 가치를 입증한다.

ABSTRACT

Due to the difficulties in replicating and scaling up qualitative studies, such studies are rarely verified. Accordingly, in this paper, we leverage the advantages of crowdsourcing (low costs, fast speed, scalable workforce) to replicate and scale-up one state-of-the-art qualitative study. That qualitative study explored 20 GitHub pull requests to learn factors that influence the fate of pull requests with respect to approval and merging. As a secondary study, using crowdsourcing at a cost of $200, we studied 250 pull requests from 142 GitHub projects. The prior qualitative findings are mapped into questions for crowds workers. Their answers were converted into binary features to build a predictor which predicts whether code would be merged with median F1 scores of 68%. For the same large group of pull requests, the median F1 scores could achieve 90% by a predictor built with additional features defined by prior quantitative results. Based on this case study, we conclude that there is much benefit in combining different kinds of research methods. While qualitative insights are very useful for finding novel insights, they can be hard to scale or replicate. That said, they can guide and define the goals of scalable secondary studies that use (e.g.) crowdsourcing+data mining. On the other hand, while data mining methods are reproducible and scalable to large data sets, their results may be spectacularly wrong since they lack contextual information. That said, they can be used to test the stability and external validity, of the insights gained from a qualitative analysis.

연구 동기 및 목표

  • 정성적 소프트웨어 공학 연구에서의 복제 및 확장성 부족 문제를 해결하기 위해.
  • 더 큰 공동 작업 기반 데이터셋을 사용하여 이전의 정성적 발견의 외부 타당성을 평가하기 위해.
  • 정성적 통찰이 어떻게 공동 작업 및 데이터 마이닝을 활용한 확장 가능한 보조 연구를 이끌고 실행 가능하게 하는지 보여주기 위해.
  • 정성적 분석에서 유도된 특징과 정량적 문헌에서 유도된 특징의 예측 성능를 비교하기 위해.
  • 경험적 소프트웨어 공학 연구에서 정성적 통찰과 확장 가능한 정량적 검증을 통합하는 방법론을 홍보하기 위해.

제안 방법

  • 2014년 TDH 연구의 정성적 발견을 공동 작업자가 평가할 수 있는 129개의 마이크로질문으로 변환하여 풀 리퀘스트 특징을 분석하였다.
  • 아마존 메카니컬 터크를 활용해 250개의 GitHub 풀 리퀘스트에서 공동 작업를 수행하였으며, 품질 제어를 위해 원본 20개 풀 리퀘스트의 골드 표준 답변을 활용하였다.
  • 지원, 대안 솔루션, 문제에 대한 반대의 정성적 요소를 나타내는 이진 특징을 공동 작업 응답에서 수집하였다.
  • 공동 작업 기반 특징, 문헌에서 유도된 특징, 하이브리드 특징을 사용하여 풀 리퀘스트 머지 결과를 예측하는 예측 모델을 구축하기 위해 데이터 마이닝 기법을 적용하였다.
  • 다양한 특징 세트 간의 모델 성능를 비교하기 위해 F₁ 점수를 주요 평가 지표로 사용하였다.
  • 동일한 마이크로질문을 사용하여 더 큰 샘플에서 원래의 정성적 발견의 일관성을 테스트함으로써 그 안정성을 검증하였다.

실험 결과

연구 질문

  • RQ1RQ1: 공동 작업를 활용해 GitHub 풀 리퀘스트 수락에 대한 비용 효율적이고 독립적인 복제 연구를 수행할 수 있는가?
  • RQ2RQ2: 더 큰 데이터셋에서 원래의 정성적 발견의 외부 타당성은 어떠한가?
  • RQ3RQ3: 정성적 통찰에서 유도된 특징와 이전 정량적 연구에서 유도된 특징 중 어느 것이 풀 리퀘스트 머지 결과를 더 잘 예측하는가?
  • RQ4RQ4: 정성적 통찰과 정량적 데이터 마이닝을 조합할 경우 예측 정확도는 어떻게 향상되는가?
  • RQ5RQ5: 공동 작업는 정성적 소프트웨어 공학 발견을 검증하는 데 전문가 판단의 확장 가능한 대체 수단으로 기능할 수 있는가?

주요 결과

  • 공동 작업 기반 복제 연구는 원래 정성적 연구에서 유도된 특징을 사용하여 풀 리퀘스트 머지 결과 예측에 중앙값 F₁ 점수 68%를 달성하였다.
  • 이전 정량적 연구에서 유도된 특징과 조합할 경우, 예측 성능이 크게 향상되어 중앙값 F₁ 점수 90%로 상승하였다.
  • 원래 TDH 연구의 네 가지 정성적 요소 중 세 가지(지원, 대안 솔루션, 문제에 대한 반대)가 더 큰 샘플에서 안정적인 외부 타당성을 보였다.
  • 제안된 솔루션에 대한 반대 요소는 더 큰 데이터셋에서 불안정하고 일관되게 예측 가능하지 않다는 것이 발견되었다.
  • 정성적 통찰이 공동 작업 기반 확장 가능한 보조 연구를 이끄는 데 필수적임을 확인하였으며, 이는 공동 작업를 위한 핵심 질문과 특징을 정의하기 때문이다.
  • 결과는 정성적 통찰이 확장 가능한 정량적 검증을 이끄는 데 사용될 경우, 고립된 접근 방식보다 더 강력하고 정확한 모델을 생성함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.