Skip to main content
QUICK REVIEW

[論文レビュー] StackOverflow vs Kaggle: A Study of Developer Discussions About Data Science

David Hin|arXiv (Cornell University)|Jun 6, 2020
Software Engineering Research被引用数 7
ひとこと要約

本研究では、197,836件の開発者ディスカッションをStackOverflowとKaggleから取得し、LDAトピックモデリングを用いて、プラットフォーム間でのデータサイエンスディスカッションを比較した。その結果、StackOverflowは低レベルのTensorFlowのトラブルシューティングに注力しているのに対し、Kaggleは実用的なリーダーボード最適化とアンサンブル手法に注力していることが判明した。Kerasへの関心は上昇しており、全体としてのDSディスカッションの成長は持続的である。

ABSTRACT

Software developers are increasingly required to understand fundamental Data science (DS) concepts. Recently, the presence of machine learning (ML) and deep learning (DL) has dramatically increased in the development of user applications, whether they are leveraged through frameworks or implemented from scratch. These topics attract much discussion on online platforms. This paper conducts large-scale qualitative and quantitative experiments to study the characteristics of 197836 posts from StackOverflow and Kaggle. Latent Dirichlet Allocation topic modelling is used to extract twenty-four DS discussion topics. The main findings include that TensorFlow-related topics were most prevalent in StackOverflow, while meta discussion topics were the prevalent ones on Kaggle. StackOverflow tends to include lower-level troubleshooting, while Kaggle focuses on practicality and optimising leaderboard performance. In addition, across both communities, DS discussion is increasing at a dramatic rate. While TensorFlow discussion on StackOverflow is slowing, interest in Keras is rising. Finally, ensemble algorithms are the most mentioned ML/DL algorithms in Kaggle but are rarely discussed on StackOverflow. These findings can help educators and researchers to more effectively tailor and prioritise efforts in researching and communicating DS concepts towards different developer communities.

研究の動機と目的

  • StackOverflowとKaggleの開発者コミュニティが、データサイエンストピックをどのように議論しているかを理解すること。
  • 両プラットフォーム間でのトピックの頻度、技術的深度、議論の焦点に差が生じる理由を特定すること。
  • TensorFlow や Keras といった人気ツールに関して、データサイエンスディスカッションの時間的傾向を分析すること。
  • 特にアンサンブル手法のような特定の機械学習アルゴリズムが、両コミュニティでどの程度顕著に取り上げられているかを検討すること。
  • 教育者や研究者らが、知識の効果的伝達のためのプラットフォーム固有のコミュニケーションパターンを理解できるようにすること。

提案手法

  • 197,836件の投稿から、24の明確に分離されたデータサイエンスディスカッショントピックを抽出するために、LDA(潜在ディリクレ割り当て)が適用された。
  • データサイエンス、機械学習、ディープラーニングに関する議論を含む、StackOverflowおよびKaggleからの投稿が収集された。
  • トピックモデリングを用いて、各プラットフォームで最も頻繁に議論されているテーマを同定・比較した。
  • 時間的経過に伴う議論のボリュームおよびトピックの人気度の変化を分析した。
  • 両コミュニティにおいて、特定のツール(例:TensorFlow、Keras)およびアルゴリズム(例:アンサンブル手法)の出現頻度を定量化した。
  • 定性的および定量的分析を統合し、トラブルシューティングとパフォーマンス最適化といった、議論の焦点の違いを評価した。

実験結果

リサーチクエスチョン

  • RQ1StackOverflowおよびKaggleで最も頻出するデータサイエンストピックは何か?
  • RQ2StackOverflowとKaggleの議論における技術的レベルと焦点領域は、どのように異なるか?
  • RQ3TensorFlow や Keras といった特定の機械学習フレームワークの人気度は、時間経過とともにどのように変化しているか?
  • RQ4なぜアンサンブルアルゴリズムはKaggleで頻出するが、StackOverflowではほとんど議論にのぼらないのか?
  • RQ5両プラットフォームにおけるデータサイエンス関連のディスカッションのボリュームは、どのように増加しているか?

主な発見

  • TensorFlow関連のトピックは、StackOverflowで最も頻出しており、低レベルの実装やデバッグにおけるその役割を反映している。
  • Kaggleでは、コンペティションのルールやデータ共有に関するメタディスカッションが最も一般的であり、コミュニティや協働作業への注力がうかがえる。
  • StackOverflowの議論は主に低レベルのトラブルシューティングに集中しているが、Kaggleの議論は実用性とリーダーボードパフォーマンス最適化に注力している。
  • Kerasへの関心はStackOverflowでも上昇しているが、TensorFlow関連の議論は減速しており、フレームワークの人気のシフトがうかがえる。
  • アンサンブル手法は、Kaggleでは最も頻出する機械学習/DLアルゴリズムであったが、StackOverflowではほとんど議論にのぼらなかった。
  • 全体として、両プラットフォームにおけるデータサイエンスディスカッションは急速に増加しており、特にMLおよびDL関連トピックにおけるコミュニティ参加の増加が顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。