Skip to main content
QUICK REVIEW

[論文レビュー] Replication Can Improve Prior Results: A GitHub Study of Pull Request Acceptance

Di Chen, Kathyrn T. Stolee|arXiv (Cornell University)|Feb 9, 2019
Mobile Crowdsensing and Crowdsourcing参考文献 52被引用数 4
ひとこと要約

本研究では、クラウドソーシングとデータマイニングを用いて、GitHubのプルリクエスト承認に関する定性的研究を部分的に再現・拡張した。元の研究の知見を190件のプルリクエストというより大きなデータセットに適用することで、F1スコア90%の予測子を構築した。これは、元の研究の定性的要因よりも顕著に優れた性能を示し、混合手法による再現が先行研究を強化することを示している。

ABSTRACT

Crowdsourcing and data mining can be used to effectively reduce the effort associated with the partial replication and enhancement of qualitative studies. For example, in a primary study, other researchers explored factors influencing the fate of GitHub pull requests using an extensive qualitative analysis of 20 pull requests. Guided by their findings, we mapped some of their qualitative insights onto quantitative questions. To determine how well their findings generalize, we collected much more data (170 additional pull requests from 142 GitHub projects). Using crowdsourcing, that data was augmented with subjective qualitative human opinions about how pull requests extended the original issue. The crowd's answers were then combined with quantitative features and, using data mining, used to build a predictor for whether code would be merged. That predictor was far more accurate that one built from the primary study's qualitative factors (F1=90 vs 68\%), illustrating the value of a mixed-methods approach and replication to improve prior results. To test the generality of this approach, the next step in future work is to conduct other studies that extend qualitative studies with crowdsourcing and data mining.

研究の動機と目的

  • プルリクエスト承認に関する主たる定性的研究からの予測精度を、クラウドソーシングとデータマイニングを用いた部分的再現によって向上させられるかを検証すること。
  • 20件のプルリクエストからなるより大きなデータセットにスケーリングすることで、過去の定性的研究の発見の外部妥当性を評価すること。
  • クラウドソーシングを経て得られた定性的知見から導出された特徴量と、文献に由来する定量的特徴量の予測性能を比較すること。
  • ソフトウェア工学研究において、専門家の知見とスケーラブルなデータ収集・分析を組み合わせた混合手法の価値を示すこと。
  • コスト効率が良く、大規模なデータ拡張とデータマイニングを可能にする再現可能な手法論を確立すること。

提案手法

  • 本研究では、過去の定性的研究(TDH)の知見をもとに、マイクロタスクの質問を設計し、プルリクエストの議論の特徴とその承認への影響に焦点を当てた。
  • MTurkのクラウドワーカーが、元の20件のプルリクエストに加え、170件の追加プルリクエストを評価し、リクエストが元の問題をどの程度拡張しているかを主観的に評価した。
  • クラウドソーシングの回答を、コメント数やマージまでの時間などの定量的メタデータと統合し、包括的なデータセットを構築した。
  • データマイニング技術を用いて、クラウドから得た特徴量と文献に由来する定量的特徴量の両方を用いて、プルリクエスト承認の予測モデルを構築した。
  • 品質管理としてゴールデンクエスチョンを導入し、複数のワーカーによる結果の集約を実施することで、信頼性を確保した。
  • F1スコアを用いて予測子の性能を評価し、クラウドアノテート特徴量に基づくモデルと、従来の定量的指標に基づくモデルを比較した。

実験結果

リサーチクエスチョン

  • RQ1クラウドソーシングを用いることで、プルリクエスト承認に関する定性的研究の部分的再現を効果的にスケーリングできるか?
  • RQ2クラウドソーシングによる評価で検証された場合、小規模なサンプルからの定性的知見がより大きなデータセットに一般化可能か?
  • RQ3クラウドアノテートデータに対するデータマイニングは、定量的特徴量のみに基づくモデルよりも、予測精度を向上させられるか?
  • RQ4クラウドソーシングを経て得られた定性的知見に基づくモデルの予測性能と、確立された定量的指標に基づくモデルの性能は、どのように比較できるか?
  • RQ5混合手法による再現は、主たる定性的研究の発見の堅牢性と正確性をどの程度向上させられるか?

主な発見

  • クラウドソーシングで得た定性的特徴量を用いて構築した予測子は、F1スコア90%を達成し、元の研究の定性的要因に基づく予測子(F1スコア68%)を顕著に上回った。
  • 文献に由来する定量的特徴量に基づくモデルは、元の定性的知見のみに基づくモデルを上回ったが、クラウド強化モデルも依然として優れた性能を示した。
  • クラウドソーシングにより、元の定性的研究の重要な発見が成功裏に再現され、スケーリングされた際の知見の安定性と外部妥当性が示された。
  • 本研究では、プルリクエスト承認が、提出者の過去の関与度や議論のダイナミクスといった要因に影響を受けることが確認された。これらの要因は、より大きなデータセット全体にわたり一貫して観察された。
  • クラウドアノテートデータに対するデータマイニングにより、定性的分析だけからは明らかでなかった、新たな実行可能な予測要因が同定された。これは、混合手法によるスケーリングの価値を示している。
  • 結果から、クラウドソーシングとデータマイニングを組み合わせることで、ソフトウェア工学における主たる定性的研究の発見の正確性と堅牢性が向上することが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。