[논문 리뷰] Large Language Models as Annotators: Enhancing Generalization of NLP Models at Minimal Cost
이 논문은 최소한의 레이블링 비용으로 NLP 모델의 일반화 성능을 향상시키기 위해 대규모 언어 모델(Large Language Models, LLMs)을 활용해 가장 정보가 많은 미라벨링 입력을 자동으로 주석 처리하는 새로운 주동 학습 전략을 제안한다. 기본 모델의 예측 점수와 미세조정된 NLP 모델의 예측 점수 간의 이탈을 측정함으로써 '조건부 정보성(Conditional Informativeness)'이라 불리는 메트릭을 도입하여, 잘못 예측될 가능성이 높은 입력을 선별함으로써, 의미 유사도 및 의미 검색 작업에서 도메인 내 및 저자료 도메인 모두에서 뚜렷한 정확도 향상을 이룬다.
State-of-the-art supervised NLP models achieve high accuracy but are also susceptible to failures on inputs from low-data regimes, such as domains that are not represented in training data. As an approximation to collecting ground-truth labels for the specific domain, we study the use of large language models (LLMs) for annotating inputs and improving the generalization of NLP models. Specifically, given a budget for LLM annotations, we present an algorithm for sampling the most informative inputs to annotate and retrain the NLP model. We find that popular active learning strategies such as uncertainty-based sampling do not work well. Instead, we propose a sampling strategy based on the difference in prediction scores between the base model and the finetuned NLP model, utilizing the fact that most NLP models are finetuned from a base model. Experiments with classification (semantic similarity) and ranking (semantic search) tasks show that our sampling strategy leads to significant gains in accuracy for both the training and target domains.
연구 동기 및 목표
- 사용자 도메인이나 희귀 의미 패턴과 같은 새로운 도메인에서 성능이 열 劣한 지도 학습 기반 NLP 모델의 일반화 문제를 해결하기 위해.
- 인간의 데이터 주석 처리 비용을 줄이기 위해 LLM을 효율적인 주석자로 활용함으로써.
- 기존의 불확실성 기반 주동 학습 전략(예: 불확실성 샘플링)에 의존하지 않고도 LLM 주석을 통해 모델의 일반화 성능을 향상시키기 위해.
- 기본 모델과 미세조정된 모델 간의 예측 점수 이탈을 기반으로 하여 가장 정보가 많은 입력을 선택하는 실용적이고 확장 가능한 방법을 개발하기 위해.
제안 방법
- 기본 모델(예: BERT)과 미세조정된 NLP 모델의 예측 점수 간의 이탈을 수량화하는 새로운 샘플링 메트릭인 '조건부 정보성'을 제안한다.
- 고정된 LLM 쿼리 예산 내에서 조건부 정보성이 가장 높은 입력을 선별하여 LLM 주석 처리를 수행한다.
- LLM으로 주석 처리된 데이터를 활용해 다시 미세조정된 NLP 모델을 훈련시켜, 훈련 도메인과 타겟 도메인 양쪽에서 성능 향상을 이룬다.
- 두 단계 프로세스를 적용한다: 첫 번째로, 미라벨링 입력 전체에 대해 점수 이탈을 계산하고, 두 번째로 상위-k 입력을 LLM 주석 처리 대상으로 선별한다.
- 미세조정된 모델이 일반적으로 기본 모델에서 시작됨을 고려하여, 점수 비교를 통해 영향력이 큰 샘플을 식별할 수 있음을 활용한다.
- 정확도 평가를 위해 타겟 도메인에서 Precision@1 (P@1)을 사용하며, 기본 모델, 미세조정된 모델, 무작위 샘플링 기반 베이스라인과 비교한다.

실험 결과
연구 질문
- RQ1LLM 기반 주석 처리가 저자료 환경에서 NLP 모델의 일반화 성능을 뚜렷이 향상시킬 수 있는가?
- RQ2인간 주석 대신 LLM 주석을 사용할 경우, 불확실성 기반 주동 학습 전략이 여전히 효과적인가?
- RQ3기본 모델과 미세조정된 모델 간의 점수 이탈을 기반으로 한 메트릭이 LLM 주석 환경에서 불확실성 기반 샘플링을 능가할 수 있는가?
- RQ4LLM 주석 처리된 모델의 성능은 인간 주석 처리 기반 베이스라인과 비교해 타겟 도메인에서 어떻게 나타나는가?
- RQ5어떤 도메인에서 LLM 주석 처리가 측정 가능한 성능 향상을 가져오며, 언제는 효과가 없을 수 있는가?
주요 결과
- 조건부 정보성이 불확실성 기반 샘플링보다 뛰어나 동일한 LLM 주석 수량으로 더 높은 정확도 향상을 달성한다.
- Quora 데이터셋에서, 훈련 세트만을 사용할 경우 LLM 주석 처리된 모델이 미국(USA) 타겟 도메인에서 9.57 P@1을 기록하여 기본 모델(12.33)과 미세조정된 모델(12.54)을 모두 초월한다.
- 아마존의 도서 도메인에서는 LLM 주석 처리로 9.48 P@1을 달성하여 기본 모델(16.78)과 미세조정된 모델(17.37)보다 뚜렷한 성능 향상을 보였다.
- 아마존의 주방(Kitchen) 도메인에서는 LLM 주석 처리로 성능 향상이 없었으며, 기본 모델이 32.91 P@1을 기록하여 LLM 데이터를 사용한 미세조정된 모델와 동일한 성능을 보였다. 이는 도메인 특화된 효과를 시사한다.
- 최적의 샘플링 임계값은 조건부 정보성 기반 상위 40% 입력으로, 전체 도메인 및 타겟 도메인 정확도를 균형 있게 유지하는 데 유리하다.
- LLM 주석 처리로 인한 성능 향상은 특히 어휘 패턴을 넘어서 세계 지식이 필요한 도메인(예: 도서 추천)에서 랜덤 샘플링보다 뚜렷하게 높았다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.