[논문 리뷰] Generative Models as a Complex Systems Science: How can we make sense of large language model behavior?
이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 복잡계로 재정의함으로써 기계적 해석과 향후 연구를 이끄는 상향식 행동 분류 체계를 제안한다. 작업 간의 타당성 있는 행동을 분류함으로써, 아키텍처에 관계없이 체계적인 분석이 가능하게 하여, 모델의 투명성 부족과 빠른 아키텍처 변화에도 불구하고 재현 가능하고 이론 기반의 연구 기반을 마련한다.
Coaxing out desired behavior from pretrained models, while avoiding undesirable ones, has redefined NLP and is reshaping how we interact with computers. What was once a scientific engineering discipline-in which building blocks are stacked one on top of the other-is arguably already a complex systems science, in which emergent behaviors are sought out to support previously unimagined use cases. Despite the ever increasing number of benchmarks that measure task performance, we lack explanations of what behaviors language models exhibit that allow them to complete these tasks in the first place. We argue for a systematic effort to decompose language model behavior into categories that explain cross-task performance, to guide mechanistic explanations and help future-proof analytic research.
연구 동기 및 목표
- 현재 기계적 해석과 이론 구축을 제한하고 있는 대규모 언어 모델(LLMs)의 급성 행동에 대한 체계적 이해 부족을 해결한다.
- 성능 지표에 집중하는 벤치마크 중심 평가의 한계를 넘어, 고수준 모델 행동을 식별하고 분류하는 데로 초점을 이동시킨다.
- 하향식 행동 분류 체계를 개발하여 상향식 기계적 분석을 이끌어내어, 의미 있는 현상에 초점을 맞추고 임의의 모델 구성 요소를 대체하는 연구를 가능하게 한다.
- LLM 출력의 규칙성을 예측할 수 있는 메타모델 프레임워크를 구축하여, 더 견고하고 일반화 가능한 모델 행동 설명을 가능하게 한다.
- 특히 전용 시스템의 지배가 지속되는 상황에서, 재현 가능하고 장기적인 과학적 연구를 위해 오픈소스 모델의 가용성을 필수로 강조한다.
제안 방법
- 기계적 해석 접근법의 한계를 드러내기 위해 '뉴포머(Newformer)'라는 가상의 비트랜스포머 기반 최첨단 생성 모델을 포함한 사고 실험을 제안한다.
- 기계적 조사의 기능적 프레임워크로 기능하는 계층적 상향식 LLM 행동 분류 체계(예: 어색한 표현 재구성, 반복, 컨텍스트 내 학습)를 제안한다.
- 기존의 해석 가능성 연구 결과(예: 인덕션 헤드, 복사 헤드)를 근거로 행동 기반 분류가 더 깊은 기계적 통찰을 이끌 수 있음을 보여주며, 제안된 분류 체계의 타당성을 뒷받침한다.
- 생성 모델을 급성 행동과 공학되지 않은 행동을 보이는 복잡계로 간주하여, 생물학적 또는 화학적 복잡계와 유사성을 강조한다.
- 모델 시뮬레이션과 재현 가능성 덕분에 물리적 복잡계보다 LLM이 더 유리한 조건을 제공함을 주장하며, 통제된 관찰자 없는 실험을 가능하게 한다.
- 장기적이고 재현 가능한 연구를 유지하기 위해 오픈소스 모델의 必요성을 강조하며, 특히 전용 모델이 능력을 지배하는 상황에서 그 중요성을 강조한다.

실험 결과
연구 질문
- RQ1어떻게 대규모 언어 모델(LLMs)의 급성 행동을 체계적으로 분류하여 기계적 해석을 이끌 수 있는가?
- RQ2상향식 행동 분류 체계는 하향식 기계적 분석의 효율성과 관련성을 어떻게 향상시키는가?
- RQ3왜 벤치마크는 LLM 성능이 다양한 작업 간에 유지되는 데 기여하는 행동을 포착하거나 설명하지 못하는가?
- RQ4아키텍처의 구체적 특성에 의존하지 않고 LLM 출력의 규칙성을 예측할 수 있는 메타모델을 어떻게 개발할 수 있는가?
- RQ5생성 모델은 어떤 방식으로 복잡계와 유사하며, 이러한 시각은 자연어 처리(NLP) 연구의 목표를 어떻게 변화시키는가?
주요 결과
- LLMs의 급성 행동(예: 컨텍스트 내 학습, 어휘 반복)은 공학된 것이 아니라 학습 과정을 통해 발견된 것으로, 복잡계의 동역학을 반영한다.
- 공통된 행동 어휘의 부재는 모델이 오픈소스화되어 있더라도 진전을 저해하며, 비대칭 임bedding 공간과 같은 행동을 설명하는 데 어려움을 겪는 것으로 나타났다.
- 기존의 해석 가능성 연구(예: 인덕션 헤드)는 행동 기반 분류가 실질적인 기계적 통찰을 이끌 수 있음을 보여주며, 제안된 분류 체계의 타당성을 검증한다.
- 아키텍처의 차이가 있더라도, 어색한 표현 재구성, 복사 등의 고수준 행동은 뉴포머와 트랜스포머를 비교할 수 있는 기반을 제공하며, 모델 간 분석을 가능하게 한다.
- 오픈소스 모델은 전용 모델이 성능을 주도하는 상황에서 재현 가능하고 장기적인 과학적 연구를 위해 필수적이다.
- 생성 모델는 시뮬레이션 가능하고 재현 가능하며 관찰자 효과가 없는 통제된 실험 조건을 갖추고 있어, 많은 자연 복잡계보다 과학적 연구에 더 적합하다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.