[論文レビュー] Can AI Serve as a Substitute for Human Subjects in Software Engineering Research?
本ビジョンペーパーは、ソフトウェア工学研究における人間被験者の代替としてスケーラブルな手法として、ChatGPTのような大規模言語モデル(LLM)を用いて合成された定性的データを生成することを提案する。ペルソナベースのプロンプト、マルチペルソナ対話、メガペルソナアンケートを活用することで、LLMは多様なユーザーの視点をシミュレートでき、インタビュー、フォーカスグループ、アンケートのための効率的なデータ収集を可能にする。これは伝統的な手法に対する有望な補完ではあるが、人間の共感や微細なニュアンスの深さが代替できないため、完全な代替とはならない。
Research within sociotechnical domains, such as Software Engineering, fundamentally requires a thorough consideration of the human perspective. However, traditional qualitative data collection methods suffer from challenges related to scale, labor intensity, and the increasing difficulty of participant recruitment. This vision paper proposes a novel approach to qualitative data collection in software engineering research by harnessing the capabilities of artificial intelligence (AI), especially large language models (LLMs) like ChatGPT. We explore the potential of AI-generated synthetic text as an alternative source of qualitative data, by discussing how LLMs can replicate human responses and behaviors in research settings. We examine the application of AI in automating data collection across various methodologies, including persona-based prompting for interviews, multi-persona dialogue for focus groups, and mega-persona responses for surveys. Additionally, we discuss the prospective development of new foundation models aimed at emulating human behavior in observational studies and user evaluations. By simulating human interaction and feedback, these AI models could offer scalable and efficient means of data generation, while providing insights into human attitudes, experiences, and performance. We discuss several open problems and research opportunities to implement this vision and conclude that while AI could augment aspects of data gathering in software engineering research, it cannot replace the nuanced, empathetic understanding inherent in human subjects in some cases, and an integrated approach where both AI and human-generated data coexist will likely yield the most effective outcomes.
研究の動機と目的
- 定性的ソフトウェア工学研究における人間被験者の参加を獲得する課題、特に代表されないグループからの参加難易度の増大に対処すること。
- AIが生成する合成テキストが、人間が提供する定性的データの代替または補完として実用的であるかどうかを検討すること。
- 基礎モデルを活用して、一般的な定性的研究手法における人間の行動や反応を模倣する実用的手法を提案すること。
- 社会的・技術的ソフトウェア工学研究においてAI生成データと人間生成データを統合する際の未解決問題や研究機会を同定すること。
- AIと人間のデータが共存する統合的アプローチを提唱し、研究のスケーラビリティと妥当性を向上させること。
提案手法
- 非技術的ユーザー、経験豊富な開発者など、特定の人口統計的・心理的属性を反映させるために、ペルソナベースのプロンプトを用いてLLMが応答を生成するように誘導すること。
- 複数の仮想参加者に異なる視点を持たせた応答を生成することで、フォーカスグループを模倣するマルチペルソナ対話技術を採用すること。
- 集約されたユーザープロフィールを模倣するメガペルソナ応答を作成し、アンケート研究に適した大規模なデータ生成を可能にすること。
- LLMの少数-shotおよび少々-shot少数-shot機能を活用し、一貫性、スタイル、行動の真正性を向上させるために応答をファインチューニングすること。
- 系統的に変化するプロンプトを設計し、異なる態度、動機、経験を反映させる応答を引き出すこと。例えば、OSS貢献者の動機を例に挙げる。
- 実際の貢献者アンケートからの統計的分布(例:3年未満の経験を持つ者が23.1%)を根拠として、合成応答の分布を設定すること。

実験結果
リサーチクエスチョン
- RQ1LLMは、ソフトウェア工学研究における実際の人間被験者の視点、動機、行動を正確に反映する合成定性的データを生成できるか?
- RQ2ペルソナベースのプロンプトは、仮想インタビューおよびフォーカスグループにおける多様なユーザープロフィールをどのようにシミュレートできるか?
- RQ3AI生成応答は、アンケートや観察研究における実際の人間の応答のばらつきや微細なニュアンスをどの程度再現できるか?
- RQ4AI生成データには、共感的で文脈に敏感な、文化的に繊細な人間の経験を捉える際にどのような限界があるか?
- RQ5AI生成データと人間が提供する定性的データをどのように意味的に統合することで、研究のスケーラビリティと妥当性を向上させられるか?
主な発見
- LLMは、人間の視点をよく模倣した合成応答を生成でき、例えば長期的なOSS貢献者の40%が、特定の問題を解決できないためプロプライエタリソフトウェアでは貢献するという主張に強く賛成する可能性があると推定できる。
- ペルソナベースのプロンプト手法により、ユーザーのタイプを一貫してシミュレート可能であり、例えば3年未満の経験を持つ貢献者の50%が、スキル向上のため貢献すると強く賛成する可能性があると推定できる。
- マルチペルソナ対話は、経験レベルや動機の異なる多様な視点を反映したフォーカスグループのグループダイナミクスを模倣できる。
- メガペルソナ応答は、統計的に妥当な分布を持つアンケート形式のデータを生成でき、例えば特定の文に「ある程度賛成」と答える貢献者が30%、中立と答える者が15%いると推定できる。
- 本手法は、実世界のユーザービヘイビアーや動機と関連性を保ちつつ、定性的データ収集のスケーラビリティを高める可能性を示している。
- これらの能力にもかかわらず、研究はAIが人間被験者を完全に代替できないと結論づける。合成応答には真の共感や文脈への深いつながりが欠けているためである。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。