[논문 리뷰] Task Ambiguity in Humans and Language Models
이 논문은 인간과 언어 모델이 작업의 모호함을 어떻게 해결하는지 연구하기 위해 6개의 모호하게 기술된 분류 작업으로 구성된 벤치마크인 AmbiBench를 소개한다. 분석 결과, 인간 피드백 데이터로 피니튜닝된 대규모 언어 모델만이 인간 수준의 성능을 달성하거나 이를 초월하는 것으로 나타났으며, 표준 모델들은 소량의 컨텍스트 내 모호한 예시로 피니튜닝을 거치면 모호한 환경에서도 뛰어난 일반화 성능을 발휘할 수 있었다.
Language models have recently achieved strong performance across a wide range of NLP benchmarks. However, unlike benchmarks, real world tasks are often poorly specified, and agents must deduce the user's intended behavior from a combination of context, instructions, and examples. We investigate how both humans and models behave in the face of such task ambiguity by proposing AmbiBench, a new benchmark of six ambiguously-specified classification tasks. We evaluate humans and models on AmbiBench by seeing how well they identify the intended task using 1) instructions with varying degrees of ambiguity, and 2) different numbers of labeled examples. We find that the combination of model scaling (to 175B parameters) and training with human feedback data enables models to approach or exceed the accuracy of human participants across tasks, but that either one alone is not sufficient. In addition, we show how to dramatically improve the accuracy of language models trained without large-scale human feedback training by finetuning on a small number of ambiguous in-context examples, providing a promising direction for teaching models to generalize well in the face of ambiguity.
연구 동기 및 목표
- 실제 세계에서 작업 명세가 명확하지 않은 상황에서 작업 모호성이 인간과 언어 모델의 성능에 미치는 영향을 조사한다.
- 일般적으로 잘 정의된 작업을 포함하는 NLP 벤치마크의 격차를 보완하기 위해, 모호한 작업 정의를 위한 벤치마크를 도입한다.
- 모델이 모호한 작업 정의 간에서 일반화하는 데 있어 컨텍스트 학습과 피니튜닝의 효과를 평가한다.
- 인간 피드백으로 트레이닝된 대규모 언어 모델이 지시의 명확성과 예시 수에 따라 변하는 조건에서 인간의 해석 성능을 따라하거나 초월할 수 있는지 탐구한다.
- 대규모 인간 피드백이 필요한 것이 아닌, 스케일링 가능한 방법으로 표준 언어 모델이 모호함을 다룰 능력을 향상시킬 수 있음을 보여준다.
제안 방법
- 모호한 지시와 입력 당 다수의 주목할 만한 언어적 특징을 지닌 6개의 분류 작업으로 구성된 AmbiBench를 제안한다.
- 자연어 지시의 명확성(정보성 있는 지시 대비 정보 없는 지시)과 컨텍스트 내 레이블이 있는 예시의 수(1~20개)를 변화시켜 인간과 언어 모델을 AmbiBench에서 평가한다.
- GPT-3 변종(예: davinci, text-davinci-002)과 작은 모델(예: ada, curie)을 포함한 다양한 언어 모델을 다양한 지시 및 예시 조건에서 훈련하고 평가한다.
- 표준 언어 모델(예: davinci)을 소량의 모호한 컨텍스트 내 예시로 피니튜닝하여 해석 성능을 향상시킨다.
- 각 예시 세트에서 하나의 특징만 변화시키는 제어 실험을 통해 피니튜닝 데이터의 모호성 영향을 고립한다.
- 모델 성능을 인간 참가자와 베이지안 오라클과 비교하여 상대적 성능 및 일반화 능력을 평가한다.
실험 결과
연구 질문
- RQ1실제 세계 유사 환경에서 지시가 명확하지 않은 상황에서 언어 모델과 인간은 어떻게 작업 모호성을 해결하는가?
- RQ2모델 크기의 확장 또는 인간 피드백 데이터를 사용할 경우, 모델의 의도된 작업 해석 능력 향상 정도는 어느 정도인가?
- RQ3소량의 모호한 컨텍스트 내 예시로 표준 언어 모델을 피니튜닝하면 해석 정확도가 크게 향상되는가?
- RQ4컨텍스트에 다수의 모호한 예시가 존재할 경우, 희소하거나 예시가 없는 경우보다 더 나은 일반화 성능을 보일 수 있는가?
- RQ5피니튜닝된 표준 모델의 성능는 인간 피드백으로 트레이닝된 대규모 모델과 비교해 보면, 새로운 모호한 작업에서 어떻게 나타나는가?
주요 결과
- 인간 피드백 데이터로 피니튜닝된 대규모 언어 모델(예: text-davinci-002)은 모든 모호한 작업 조건에서 인간 참가자와 동일하거나 이를 초월하는 성능을 보였다.
- 인간 피드백 피니튜닝 없이 표준 언어 모델(예: davinci)은 특히 정보 없는 지시나 적은 수의 예시가 있을 경우 모호한 작업에서 성능이 열악했다.
- 단지 20개의 모호한 컨텍스트 내 예시로 피니튜닝하기만 해도 성능 향상이 크게 이루어졌으며, 이는 새로운 모호한 작업에서 인간 피드백 트레이닝된 모델의 성능을 초월하는 데 성공했다.
- 높은 성능를 달성하기 위해 모델 확장과 인간 피드백의 조합이 필요하며, 두 요소 중 하나만으로는 인간 수준의 해석 능력을 달성하기에는 부족했다.
- 컨텍스트 내 예시 수가 증가할수록 성능 향상이 이루어지지만, 가장 뚜렷한 성과 향상은 단순히 더 많은 예시를 제공하는 것보다는 모호한 예시로 피니튜닝하는 데 기인했다.
- 제어 실험을 통해 피니튜닝의 성능 향상 요인이 모호함을 해결하는 데 학습하는 것임을 확인하였으며, 다양한 문장 구조에 노출된 것 때문이 아니었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.