Skip to main content
QUICK REVIEW

[논문 리뷰] Wisdom of Instruction-Tuned Language Model Crowds. Exploring Model Label Variation

Flor Miriam Plaza-del-Arco, Debora Nozza|arXiv (Cornell University)|2023. 07. 24.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 다섯 개인 최신 지침 튜닝 언어 모델 간의 레이블 변동성을 집단 주석의 형태로 활용하여 제로샷 텍스트 분류 성능을 향상시키는 것을 제안한다. 베이지안 가중치를 사용한 예측 집계 방식—인간의 공감과 유사하게—모델 앙상블은 평균적으로 개별 모델보다 8.3 F1 점수 놈 향상되지만, 여전히 단순 지도 학습 모델에 뒤지며 성능이 열등하다.

ABSTRACT

Large Language Models (LLMs) exhibit remarkable text classification capabilities, excelling in zero- and few-shot learning (ZSL and FSL) scenarios. However, since they are trained on different datasets, performance varies widely across tasks between those models. Recent studies emphasize the importance of considering human label variation in data annotation. However, how this human label variation also applies to LLMs remains unexplored. Given this likely model specialization, we ask: Do aggregate LLM labels improve over individual models (as for human annotators)? We evaluate four recent instruction-tuned LLMs as annotators on five subjective tasks across four languages. We use ZSL and FSL setups and label aggregation from human annotation. Aggregations are indeed substantially better than any individual model, benefiting from specialization in diverse tasks or languages. Surprisingly, FSL does not surpass ZSL, as it depends on the quality of the selected examples. However, there seems to be no good information-theoretical strategy to select those. We find that no LLM method rivals even simple supervised models. We also discuss the tradeoffs in accuracy, cost, and moral/ethical considerations between LLM and human annotation.

연구 동기 및 목표

  • 다양한 텍스트 분류 작업 전반에서 다수의 대규모 언어 모델을 제로샷 주석자로 활용하는 데서의 효과성을 평가하는 것.
  • 인간 주석자 간의 이견과 유사한 LLM 간의 레이블 변동성을 활용하여 예측 신뢰도를 향상시킬 수 있는지 조사하는 것.
  • 다양한 언어와 작업에서 집계된 LLM 예측 성능을 개별 모델 및 지도 학습 기반 베이스라인과 비교하는 것.
  • LLM 기반 주석과 인간 주석 간의 비용, 속도, 정확도, 편향 간의 상충 관계를 분석하는 것.
  • 특히 민감하거나 주관적인 작업에서 인간 주석을 LLM 앙상블로 대체할 경우의 윤리적 및 실용적 영향을 검토하는 것.

제안 방법

  • 다섯 개의 최신 지침 튜닝된 LLM(GPT-3.5, PaLM, Flan-T5 포함)을 제로샷 설정에서 사용하여 텍스트를 사전 정의된 레이블로 분류하도록 프롬프트를 제공한다.
  • 각 모델를 독립적인 주석자로 간주하여 골드 레이블에 접근하지 못한 상태에서 동일한 입력에 대해 예측을 생성한다.
  • 골드 레이블이 필요 없도록, 추론된 신뢰도를 기반으로 개별 모델 예측을 가중치 부여하기 위해 주석 모델의 베이지안 모델을 적용한다.
  • 집계 기법으로는 다수결 투표와 베이지안 분류기 조합을 사용하며, 후자는 정확도와 강건성을 향상시키기 위해 사용된다.
  • 성능 평가를 위해 다국어 데이터셋(영어, 프랑스어, 독일어, 스페인어)에서 감성, 주제, 연령, 성별, 혐오 발언 예측 등 다섯 가지 작업을 대상으로 한다.
  • 모델들이 훈련 분포에 포함되지 않은 데이터로 테스트되도록 Trustpilot와 HatEval의 보류된 테스트 세트를 사용한다.

실험 결과

연구 질문

  • RQ1다수의 지시 튜닝된 LLM 예측을 집계함으로써 개별 모델을 뛰어넘는 제로샷 텍스트 분류 성능 향상을 달성할 수 있는가?
  • RQ2모델 성능는 다양한 작업과 언어에서 어떻게 변화하는가? 특정 단일 LLM이 일관되게 슈퍼리어리티를 보이는가?
  • RQ3LLM 간의 레이블 변동성이 인간 주석자 간 이견과 얼마나 유사한가? 이를 동일한 방식으로 활용할 수 있는가?
  • RQ4집계된 LLM 예측 성능는 단순 지도 학습 모델 및 인간 주석 기반 베이스라인과 비교해 어떻게 되는가?
  • RQ5특히 편향과 노동 대체 문제를 고려할 때 인간 주석을 LLM 앙상블로 대체하는 데서 윤리적 및 실용적 영향은 무엇인가?

주요 결과

  • 단일 LLM이 모든 작업, 언어, 레이블 유형에서 뛰어나지 않으며, 성능은 상당히 다양하게 나타나 일부 모델은 특정 작업에서 무작위 베이스라인보다도 열등하다.
  • 베이지안 가중치를 사용한 집계 예측은 모든 개별 모델보다 평균적으로 8.3 F1 점수 놈 향상되며, 앙상블 방법의 가치를 입증한다.
  • 최고의 집계된 LLM 성능조차도 단순 지도 학습 모델에 비해 상당히 뒤지며, 평균적으로 10 F1 점수 이상의 격차를 보인다.
  • 프랑스어 및 독일어와 같은 자원이 적은 언어에서 성능이 크게 떨어지며, 현재의 다국어 일반화 능력의 한계를 보여준다.
  • 레이블 집계는 일부 개별 모델의 편향을 완화하지만, 기반 모델에 공통으로 존재하는 광범위한 편향은 제거할 수 없다.
  • 이 연구는 LLM 집계가 인간 주석보다 비용 효율적이고 빠르지만, 고성능 및 윤리적으로 책임감 있는 NLP 응용 분야에서는 여전히 인간 주석이 필수적이라고 결론 내린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.