[論文レビュー] 40 Years of Designing Code Comprehension Experiments: A Systematic Mapping Study
本研究は、1979年から2019年までの95件のコード理解実験を体系的マッピング研究として分析し、共通する設計パターンを同定し、方法論的欠陥を浮き彫りにした上で、今後の研究における改善策を提案する。研究では、研究設計および報告における広範な不整合性が明らかになった。本研究は、比較可能性、妥当性、再現可能性を高めるために、構造的なフレームワークと実行可能な提言を提供する。実証的ソフトウェア工学分野におけるコード理解研究の質を向上させる基盤を提供する。
The relevance of code comprehension in a developer's daily work was recognized more than 40 years ago. Consequently, many experiments were conducted to find out how developers could be supported during code comprehension and which code characteristics contribute to better comprehension. Today, such studies are more common than ever. While this is great for advancing the field, the number of publications makes it difficult to keep an overview. Additionally, designing rigorous code comprehension experiments with human participants is a challenging task, and the multitude of design options can make it difficult for researchers, especially newcomers to the field, to select a suitable design. We therefore conducted a systematic mapping study of 95 source code comprehension experiments published between 1979 and 2019. By structuring the design characteristics of code comprehension studies, we provide a basis for subsequent discussion of the huge diversity of design options in the face of a lack of basic research on their consequences and comparability. We describe what topics have been studied, as well as how these studies have been designed, conducted, and reported. Frequently chosen design options and deficiencies are pointed out to support researchers of all levels of domain expertise in designing their own studies.
研究の動機と目的
- 人間被験者を対象としたコード理解実験の設計および報告の最先端状況を分析すること。
- 95件の実証的研究において繰り返し見られる設計選択、欠陥、妥当性の脅威を同定すること。
- 研究者、特に初心者を支援するため、一般的な設計パターンを統合的に整理し、ベストプラクティスを強調すること。
- 比較可能性および再現可能性を高めるために、研究設計、測定、報告の分野における具体的な改善策を提案すること。
- 今後のメタアナリシスや研究統合のための、公開可能な抽出済み設計特性データセットを構築すること。
提案手法
- PRISMA指針に従い、95件の査読済みコード理解実験から設計特性を同定・抽出する体系的マッピング研究(SMS)を実施した。
- 研究要因(タスク、測定、教材、妥当性の脅威など)を分類するため、15の包括的な設計特性を定義・適用した。
- 各主要研究から設計データを手動で抽出し、方法論の透明性と一貫性に重点を置いた。
- 研究分野、設計タイプ、報告品質の観点から研究を分類し、トレンドとギャップを同定した。
- テーマ的および定量的分析を用いて、設計選択の頻度と報告における繰り返し問題を評価した。
- 同定された欠陥とベストプラクティスに基づき、研究コミュニティ向けに5つの実行可能な提言を提示した。
実験結果
リサーチクエスチョン
- RQ1コード理解実験で最も頻繁に使用された設計特性は何か。また、過去40年間でその傾向はどのように変化したか。
- RQ2コード理解実験で最もよく研究された研究分野は何か。
- RQ3報告された妥当性の脅威の中で最も一般的なものは何か。また、それらは研究間で一貫して対処されているか。
- RQ4タスク、測定、教材の観点から、研究設計はどのように変動しているのか。その比較可能性に与える影響は何か。
- RQ5コード理解実験の報告における主な欠陥は何か。また、それらはどのように改善できるか。
主な発見
- コード理解実験の大多数(78%)がタスクベースの理解タスクを採用しており、特にバグ修正と機能実装が最も一般的であった。
- 時間ごとの作業時間(time-on-task)が最も頻繁に使用された性能測定指標(65%)であり、その後に理解度に関する質問の正答率(58%)、自己評価(42%)が続いた。
- 有効な妥当性の脅威をすべて報告した研究はわずか23%にとどまり、多くの研究が交絡要因や一般化の問題を議論していなかった。
- 大きな割合の研究(41%)がコード理解の定義を明確にしなかったため、測定対象が曖昧であった。
- 心理生理的測定の使用が増加しており、これはプログラム理解研究における神経科学的基盤の拡大傾向を示している。
- 設計要因の構造的要約を提供した研究はわずか12%にとどまり、報告の透明性と再利用可能性に大きなギャップがあることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。