[논문 리뷰] Limitations of Language Models in Arithmetic and Symbolic Induction
이 논문은 대규모 언어 모델(Large Language Models, LLMs)이 산술 덧셈, 복사, 순서 뒤집기와 같은 기호적 조작 작업에서 분포 외(out-of-distribution, OOD) 설정이나 고반복 조건에서 겪는 한계를 조사한다. 특히 표준 LLMs가 실패하는 상황에서 100% 정확도를 달성하는 새로운 방법인 '튜터가 있는 LMs'를 제안한다. 이 방법은 명시적인 추론 예시를 통해 모델을 단계별로 지도함으로써 성능을 향상시킨다.
Recent work has shown that large pretrained Language Models (LMs) can not only perform remarkably well on a range of Natural Language Processing (NLP) tasks but also start improving on reasoning tasks such as arithmetic induction, symbolic manipulation, and commonsense reasoning with increasing size of models. However, it is still unclear what the underlying capabilities of these LMs are. Surprisingly, we find that these models have limitations on certain basic symbolic manipulation tasks such as copy, reverse, and addition. When the total number of symbols or repeating symbols increases, the model performance drops quickly. We investigate the potential causes behind this phenomenon and examine a set of possible methods, including explicit positional markers, fine-grained computation steps, and LMs with callable programs. Experimental results show that none of these techniques can solve the simplest addition induction problem completely. In the end, we introduce LMs with tutor, which demonstrates every single step of teaching. LMs with tutor is able to deliver 100% accuracy in situations of OOD and repeating symbols, shedding new insights on the boundary of large LMs in induction.
연구 동기 및 목표
- 대규모 언어 모델(LLMs)이 복사, 뒤집기, 덧셈과 같은 기본 기호 조작 작업에서 분포 외(OOD) 또는 고반복 조건에서 실패하는 이유를 조사하는 것.
- 특히 반복 기호를 처리하거나 생성 과정에서 위치 인식을 유지하는 데 어려움을 겪는 실패의 근본 원인을 규명하는 것.
- 세부 계산 단계, 위치 표시자, 호출 가능한 프로그램과 같은 기존 보완 전략이 LLM의 기호 조작 작업에 대한 일반화 성능을 향상시키는 데 얼마나 기여하는지 평가하는 것.
- 기존의 표준 프ompting 방식이 실패하는 OOD 및 고반복 기호 유도 작업에서 강력하고 100% 정확도를 달성하는 데 성공하는 새로운 방법인 '튜터가 있는 LMs'를 제안하고 검증하는 것.
제안 방법
- 모델이 15개의 단계별 추론 예시를 포함한 프ompt를 통해 '튜터가 있는 LMs'를 도입한다. 이는 각 연산(예: 이동, 복사, 뒤집기)을 체계적이고 원자적인 방식으로 나타낸다.
- 사람이 읽을 수 있는 명시적 추론 단계(예: '항목 1을 위치 3으로 이동')를 사용하여 모델이 기호적 연산을 단계별로 수행하도록 안내하며, 이는 교사의 지도 역할을 모방한다.
- 입력과 중간 단계를 모두 포함하는 프ompt 형식을 사용하며, 항목의 위치를 추적하기 위해 'rmov'(역방향 이동) 또는 'lmov'(왼쪽 이동) 등의 연산을 활용한다.
- 표준 few-shot 프ompting, 세부 계산 단계, 위치 표시자(암시적 또는 명시적), 호출 가능한 프로그램을 포함한 여러 작업(덧셈, 복사, 뒤집기)에서 비교한다.
- 모델을 분포 내 데이터(최대 5개의 항목 또는 숫자)로 훈련하고, 분포 외 데이터(최대 30개의 항목 또는 숫자)와 고반복 수준에서 일반화 성능을 평가한다.
- 상대적 위치 임베딩을 포함한 아키텍처 구성 요소의 영향을 분리하기 위해 T5, GPT-3, DeBERTa 모델을 사전 훈련 유무로 비교한다.
실험 결과
연구 질문
- RQ1대규모 언어 모델(LLMs)이 반복 기호가 포함되거나 훈련 분포를 초월하는 입력에서 복사 및 순서 뒤집기와 같은 단순 기호 조작 작업에서 실패하는 이유는 무엇인가?
- RQ2세부 계산 단계나 명시적 위치 표시자가 LLM의 기호 유도 작업에서의 일반화 성능 향상에 얼마나 기여하는가?
- RQ3호출 가능한 프로그램 또는 프로그램 무관 방법이 산술 및 기호 추론에서 OOD 일반화를 향상시킬 수 있는가?
- RQ4체계적이고 단계별 지도 방법('튜터가 있는 LMs')이 표준 프ompting 방식이 실패하는 OOD 및 고반복 기호 작업에서 LLM이 100% 정확도를 달성하는 데 기여하는가?
주요 결과
- GPT-3 및 T5와 같은 표준 LLMs는 덧셈과 복사 작업에서 분포 내 정확도는 높지만, 반복 숫자나 긴 시퀀스가 포함된 OOD 입력에서는 정확도가 크게 떨어진다.
- 세부 계산 단계나 명시적 위치 표시자를 사용하더라도 T5 및 DeBERTa 모델은 뒤집기 작업에서 20~30개 이상의 항목을 초월해 일반화에 실패하며, 이는 제한된 위치 인식 능력을 시사한다.
- 상대적 위치 임베딩을 갖춘 DeBERTa 모델은 기호 작업에서 빠르게 과적합되며, 2,000단계 이내에 분포 내 정확도 100%를 달성하지만 OOD 데이터에서는 실패한다. 이는 일반화 능력이 떨어짐을 의미한다.
- '튜터가 있는 LMs' 방법은 복사, 뒤집기, 덧셈 작업 전반에서 OOD 및 고반복 설정에서 100% 정확도를 달성하며, 모든 기준 모델을 압도한다.
- 호출 가능한 프로그램은 덧셈 작업에서 OOD 성능을 향상시키며, 이는 강력한 추론을 위해 기초 기호 연산을 명시적으로 모델링해야 한다는 것을 시사한다.
- 본 연구는 현재 LLMs가 심지어 스케일업된 상태에서도 신뢰할 수 있는 위치 인식 및 기호 유도 능력을 갖추지 못하고 있으며, 이러한 한계를 극복하기 위해 체계적 지도가 필수적임을 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.