[논문 리뷰] Using Large Language Models to Create AI Personas for Replication, Generalization and Prediction of Media Effects: An Empirical Test of 133 Published Experimental Research Findings
이 연구는 마케팅 연구에서 미디어 효과를 재현하고 일반화하며 예측하기 위해 대규모 언어 모델(Large Language Models, LLMs)을 인공지능(persona)으로 평가한다. 14권의 Journal of Marketing 논문에서 유래한 133개의 실험적 발견을 바탕으로 19,447명의 AI 참가자를 생성한 결과, LLMs는 주효과의 76% (111개 중 84개)와 모든 효과의 68% (133개 중 90개)를 성공적으로 재현했으며, 미디어 및 마케팅 심리학 분야에서 이론 구축을 가속화하고 복제 가능성을 향상시키는 데 강력한 잠재력을 보였다.
This report analyzes the potential for large language models (LLMs) to expedite accurate replication and generalization of published research about message effects in marketing. LLM-powered participants (personas) were tested by replicating 133 experimental findings from 14 papers containing 45 recent studies published in the Journal of Marketing. For each study, the measures, stimuli, and sampling specifications were used to generate prompts for LLMs to act as unique personas. The AI personas, 19,447 in total across all of the studies, generated complete datasets and statistical analyses were then compared with the original human study results. The LLM replications successfully reproduced 76% of the original main effects (84 out of 111), demonstrating strong potential for AI-assisted replication. The overall replication rate including interaction effects was 68% (90 out of 133). Furthermore, a test of how human results generalized to different participant samples, media stimuli, and measures showed that replication results can change when tests go beyond the parameters of the original human studies. Implications are discussed for the replication and generalizability crises in social science, the acceleration of theory building in media and marketing psychology, and the practical advantages of rapid message testing for consumer products. Limitations of AI replications are addressed with respect to complex interaction effects, biases in AI models, and establishing benchmarks for AI metrics in marketing research.
연구 동기 및 목표
- 사회과학 분야의 복제 및 일반화 위기를 해결하기 위해 LLMs를 인공 참가자로 활용하여 테스트한다.
- 빠르고 스케일링 가능한 메시지 테스트를 통해 미디어 및 마케팅 심리학 분야의 이론 구축을 가속화한다.
- 다양한 자극과 측정 수단을 통해 출판된 실험적 발견을 재현할 때 LLM이 생성한 데이터의 정밀도를 평가한다.
- 특히 복잡한 상호작용 효과와 모델 편향에 대한 AI 복제의 한계를 평가한다.
- 미래의 방법론적 혁신을 지원하기 위해 마케팅 연구에서 AI 메트릭의 기준을 설정한다.
제안 방법
- Journal of Marketing에 게재된 14편의 논문에서 연구 설계 요소(측정 척도, 자극, 표본 설계 등)를 추출했다.
- 프롬프트 엔지니어링을 활용해 다양한 참가자 프로필을 시뮬레이션하는 고유한 LLM 인공지능(persona)을 생성했다.
- 실제 참가자처럼 자극에 응답하는 방식으로 완전한 데이터셋을 생성하도록 LLM을 지시했다.
- AI로 생성된 데이터에 통계 분석을 수행하고 원본 인간 연구 결과와 비교했다.
- 주효과 및 상호작용 효과의 효과 크기, p값, 유의수준을 비교하여 복제 성공 여부를 평가했다.
- 참가자 샘플, 미디어 자극, 측정 도구를 원본 연구와 다르게 설정하여 일반화 능력을 테스트했다.
실험 결과
연구 질문
- RQ1LLM이 생성한 AI 인공지능은 133개의 출판된 미디어 효과 실험의 주효과를 얼마나 정확하게 재현할 수 있는가?
- RQ2참가자 샘플, 자극 또는 측정 도구를 원본 연구와 다르게 설정했을 때 LLM 복제의 일반화 능력은 어떠한가?
- RQ3LLMs는 미디어 및 마케팅 연구에서 복잡한 상호작용 효과를 재현하는 데 어떤 한계를 지니는가?
- RQ4통계적 유의성과 효과 크기 측면에서 AI로 생성된 결과는 원본 인간 연구 결과와 어떻게 비교되는가?
- RQ5LLMs를 마케팅 연구에서 신뢰성 있게 사용하기 위해 필요한 기준과 방법론적 표준은 무엇인가?
주요 결과
- LLMs는 테스트한 133개 실험 발견에서 주효과 84개 중 76%를 성공적으로 재현했다.
- 상호작용 효과를 포함한 전체 복제율은 68% (133개 중 90개)로 나타나 강력하지만 완벽한 정밀도는 아님을 시사한다.
- 참가자 샘플, 미디어 자극, 측정 도구를 변경하여 일반화를 테스트한 결과, 정확도가 변동함을 확인하여 AI 결과가 매개변수 변화에 따라 달라질 수 있음을 보였다.
- AI 복제가 스케일링과 속도의 장점을 지녀 소비자 제품 개발에서 빠른 메시지 테스트에 실용적인 이점을 제공함을 확인했다.
- 복잡한 상호작용 효과 모델링 및 LLM 출력의 잠재적 편향에 대한 한계가 관찰되어 철저한 검증이 필요함을 시사했다.
- 본 연구는 미디어 및 마케팅 심리학 분야에서 이론 구축을 가속화하고 재현 가능성을 향상시키기 위해 LLM을 확장 가능한 도구로 활용할 수 있는 기반을 마련했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.