[논문 리뷰] Increasing Diversity While Maintaining Accuracy: Text Data Generation with Large Language Models and Human Interventions
이 논문은 대규모 언어 모델(Large Language Models, LLMs)과 타겟된 인간 간섭을 조합하여 높은 다양성과 정확도를 갖춘 텍스트 데이터셋을 생성하는 인간-AI 협업 프레임워크를 제안한다. 다양성을 높이기 위해 로짓 억제와 온도 샘플링을 적용하고, 잘못된 레이블를 교정하기 위해 레이블 교체를 사용함으로써 정확도가 14.4%p 향상되었으며, LLM이 생성한 데이터로 훈련된 모델은 GPT-3의 소수 샘플 분류 성능을 능가한다.
Large language models (LLMs) can be used to generate text data for training and evaluating other models. However, creating high-quality datasets with LLMs can be challenging. In this work, we explore human-AI partnerships to facilitate high diversity and accuracy in LLM-based text data generation. We first examine two approaches to diversify text generation: 1) logit suppression, which minimizes the generation of languages that have already been frequently generated, and 2) temperature sampling, which flattens the token sampling probability. We found that diversification approaches can increase data diversity but often at the cost of data accuracy (i.e., text and labels being appropriate for the target domain). To address this issue, we examined two human interventions, 1) label replacement (LR), correcting misaligned labels, and 2) out-of-scope filtering (OOSF), removing instances that are out of the user's domain of interest or to which no considered label applies. With oracle studies, we found that LR increases the absolute accuracy of models trained with diversified datasets by 14.4%. Moreover, we found that some models trained with data generated with LR interventions outperformed LLM-based few-shot classification. In contrast, OOSF was not effective in increasing model accuracy, implying the need for future work in human-in-the-loop text data generation.
연구 동기 및 목표
- LLM을 사용하여 최종 분류 작업을 위한 고품질, 다각도, 정확한 텍스트 데이터셋을 생성하는 데 도전한다.
- LLM 텍스트 생성에서 기술적 다양화 방법이 데이터 품질과 최종 모델 성능에 미치는 영향을 조사한다.
- 특히 레이블 교체와 범위 외 필터링을 포함한 인간 간섭의 영향을 평가하여 LLM이 생성한 데이터셋의 정확도와 다양성 향상 여부를 분석한다.
- 인간에 의해 교정되고 다양성이 확보된 LLM 생성 데이터가 소수 샘플 GPT-3 분류 성능을 뛰어넘을 수 있음을 입증한다.
- 현재 인간이 개입하는 전략에서의 한계를 규명하며, 특히 범위 외 필터링이 모델 정확도 향상에 효과적이지 않다는 점을 지적한다.
제안 방법
- 텍스트 생성 중 자주 발생하는 토큰을 억제함으로써 반복을 줄이기 위해 로짓 억제를 적용한다.
- 토큰 확률 분포를 평탄하게 하여 덜 가능성은 높지만 다양한 시퀀스를 생성하도록 유도하기 위해 고온 샘플링을 사용한다.
- LLM이 생성한 데이터의 잘못된 레이블를 교정하기 위해 인간 간섭으로서 레이블 교체(LR)를 구현한다.
- 대상 도메인에 속하지 않거나 유효한 레이블이 없는 인스턴스를 제거하기 위해 범위 외 필터링(OOSF)을 적용한다.
- 오라클 연구를 수행하여 인간의 교정을 시뮬레이션하고, 프oxy 모델을 사용해 그 영향을 모델 성능 평가에 활용한다.
- 인간 간섭 유무에 따라 LLM 생성 데이터셋을 기반으로 최종 분류 모델을 훈련하고 평가하여 정확도, 다양성, 원본 데이터셋과의 유사도를 측정한다.

실험 결과
연구 질문
- RQ1로짓 억제와 온도 샘플링은 LLM이 생성한 텍스트 데이터의 다양성과 정확도에 어떤 영향을 미치는가?
- RQ2레이블 교체가 다양화된 LLM 생성 데이터셋으로 훈련된 모델의 정확도 향상에 어느 정도 기여하는가?
- RQ3범위 외 필터링은 모델 정확도 향상에 효과적인가, 아니면 유용한 학습 인스턴스를 제거함으로써 성능을 떨어뜨리는가?
- RQ4인간 간섭을 통해 향상된 LLM 생성 데이터셋은 GPT-3의 소수 샘플 학습 성능을 뛰어넘을 수 있는가?
- RQ5다양화 전략과 인간 간섭 전략의 다양한 조합이 모델 일반화 및 데이터 품질 지표에 어떤 영향을 미치는가?
주요 결과
- 로짓 억제와 고온 샘플링은 텍스트 다양성을 성공적으로 증가시키지만, 레이블 정확도와 원본 데이터셋과의 유사도를 크게 떨어뜨린다.
- 오라클 연구에서 레이블 교체로 인해 다양화된 LLM 생성 데이터셋으로 훈련된 모델의 절대 정확도가 14.4%p 향상되었다.
- 180개의 레이블 교체 인스턴스를 적용한 결과, LLM 생성 데이터셋으로 훈련된 모델이 GPT-3 소수 샘플 분류 성능을 뛰어넘었다.
- 범위 외 필터링은 모델 정확도 향상에 기여하지 않았고, 때로는 다양성을 감소시켜, 보다 정교한 기준 없이선 효과적인 전략이 아님을 시사한다.
- 다양화와 레이블 교체의 조합은 교정되지도 않은 또는 필터링된 데이터보다 더 안정적이고 높은 성능을 보였다.
- 범위 외 필터링은 데이터 품질 지표에 거의 영향을 주지 않았으며, 95% 신뢰구간 내에서 레이블 정확도, 다양성, 유사도에 미미하거나 유의미한 변화가 없었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.