[논문 리뷰] Can AI Serve as a Substitute for Human Subjects in Software Engineering Research?
이 시각 논문은 소프트웨어 공학 연구에서 인간 참가자를 대체할 수 있는 확장 가능한 방법으로, ChatGPT와 같은 대규모 언어 모델(LLM)을 활용해 합성 정성 데이터를 생성하는 것을 제안한다. 페르소나 기반 프롬프팅, 다중 페르소나 대화, 마스터 페르소나 설문 조사 기법을 통해 LLM은 다양한 사용자 관점을 시뮬레이션할 수 있으며, 인터뷰, 포커스 그룹, 설문 조사 등에 효율적인 데이터 수집을 가능하게 한다. 기존 방법에 비해 유망한 보완 수단이지만, 인간의 진정한 공감 능력과 세밀한 맥락 인식 능력이 빈곤한 점을 감안하면 완전한 대체는 어려우므로.
Research within sociotechnical domains, such as Software Engineering, fundamentally requires a thorough consideration of the human perspective. However, traditional qualitative data collection methods suffer from challenges related to scale, labor intensity, and the increasing difficulty of participant recruitment. This vision paper proposes a novel approach to qualitative data collection in software engineering research by harnessing the capabilities of artificial intelligence (AI), especially large language models (LLMs) like ChatGPT. We explore the potential of AI-generated synthetic text as an alternative source of qualitative data, by discussing how LLMs can replicate human responses and behaviors in research settings. We examine the application of AI in automating data collection across various methodologies, including persona-based prompting for interviews, multi-persona dialogue for focus groups, and mega-persona responses for surveys. Additionally, we discuss the prospective development of new foundation models aimed at emulating human behavior in observational studies and user evaluations. By simulating human interaction and feedback, these AI models could offer scalable and efficient means of data generation, while providing insights into human attitudes, experiences, and performance. We discuss several open problems and research opportunities to implement this vision and conclude that while AI could augment aspects of data gathering in software engineering research, it cannot replace the nuanced, empathetic understanding inherent in human subjects in some cases, and an integrated approach where both AI and human-generated data coexist will likely yield the most effective outcomes.
연구 동기 및 목표
- 특히 소외된 집단에서의 인간 참가자 모집이 점점 어려워지는 문제를 해결하기 위해 소프트웨어 공학 연구의 정성적 연구에 있어 인간 참가자를 대체할 수 있는 방법을 모색한다.
- 인공지능이 생성한 합성 텍스트가 인간이 제공하는 정성적 데이터의 실질적인 대안 또는 보완으로 기능할 수 있는지 탐색한다.
- 기초 모델을 활용해 일반적인 정성적 연구 방법론에서 인간의 행동과 반응을 시뮬레이션할 수 있는 실용적인 방법을 제안한다.
- 사회기술적 소프트웨어 공학 연구에서 AI가 생성한 데이터와 인간이 생성한 데이터를 통합할 때 발생하는 열린 문제점과 연구 기회를 규명한다.
- AI와 인간 데이터가 공존하는 통합적 접근을 주장하여 연구의 확장성과 타당성을 향상시킨다.
제안 방법
- 비특정 기술자나 경험이 많은 개발자와 같은 특정 인구통계학적 또는 심리적 프로필을 반영하도록 LLM을 유도하기 위해 페르소나 기반 프롬프팅을 활용한다.
- 다양한 시각을 지닌 다수의 가상 참가자로부터의 반응을 생성함으로써 포커스 그룹을 시뮬레이션하기 위해 다중 페르소나 대화 기법을 활용한다.
- 집계된 사용자 프로필을 바탕으로 설문 조사 응답을 모방하는 마스터 페르소나 응답을 생성하여 설문 기반 연구에 대규모 데이터 생성을 가능하게 한다.
- LLM의 소수 샘플 및 소수 샘플 소수 샘플 기능을 활용해 일관성, 스타일, 행동의 진정성에 맞게 반응을 보정한다.
- 다양한 태도, 동기, 경험을 반영하도록 체계적으로 변형된 프롬프트를 설계하여, 예를 들어 오픈소스 소프트웨어 기여자의 동기와 같은 요소를 유도한다.
- 실제 기여자 설문 조사에서 유래한 통계 분포(예: 23.1%가 3년 미만의 경력)를 활용해 합성 응답 분포를 근거화하고 기반화한다.

실험 결과
연구 질문
- RQ1LLM은 소프트웨어 공학 연구에서 실제 인간 참가자의 관점, 동기, 행동을 정확하게 반영하는 합성 정성 데이터를 생성할 수 있는가?
- RQ2페르소나 기반 프롬프팅은 가상 인터뷰 및 포커스 그룹에서 다양한 사용자 프로필을 어떻게 시뮬레이션할 수 있는가?
- RQ3AI가 생성한 응답은 설문 조사 및 관찰 연구에서 실제 인간 응답의 다양성과 세부성을 어느 정도 재현할 수 있는가?
- RQ4AI가 생성한 데이터는 진정한 공감 능력, 맥락 민감도, 문화적 세부 정보를 반영하는 데 어떤 한계를 지니는가?
- RQ5AI가 생성한 데이터와 인간이 제공한 정성적 데이터를 어떻게 의미 있게 통합하여 연구의 확장성과 타당성을 향상시킬 수 있는가?
주요 결과
- LLM은 인간의 관점과 유사한 합성 응답을 생성할 수 있으며, 예를 들어 장기적인 오픈소스 기여자 중 약 40%가 특정 문제를 해결할 수 없는 프prietary 소프트웨어 때문에 기여한다고 강하게 동의할 가능성이 높다고 추정할 수 있다.
- 페르소나 기반 프롬프팅 기법은 사용자 유형을 일관되게 시뮬레이션할 수 있으며, 예를 들어 3년 미만의 경력 기여자 중 약 50%가 자신의 기술을 향상시키기 위해 기여한다고 강하게 동의할 가능성이 높다고 추정할 수 있다.
- 다중 페르소나 대화 기법은 경험 수준과 동기의 다양성을 반영한 포커스 그룹의 집단 역학을 시뮬레이션할 수 있다.
- 마스터 페르소나 응답은 통계적으로 타당한 분포를 지닌 설문 유사 데이터를 생성할 수 있으며, 예를 들어 특정 문장에 대해 30%의 기여자가 어느 정도 동의할 가능성이 있고, 15%는 중립적일 가능성이 있다고 추정할 수 있다.
- 이 방법은 실제 사용자 행동과 동기와 관련성이 유지되면서도 정성적 데이터 수집의 스케일링 잠재력을 보여준다.
- 이러한 능력에도 불구하고, 연구는 AI가 인간 참가자를 완전히 대체할 수 없다는 결론을 내리며, 합성 응답에서 진정한 공감 능력과 맥락 깊은 깊이가 부족하기 때문이라고 설명한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.