[논문 리뷰] Large Language Model Programs
이 논문은 사전 훈련된 LLM을 명시적 알고리즘 내에 통합함으로써 추론 및 알고리즘 능력을 향상시키는 Large Language Model Programs (LLM Programs)라는 방법을 소개한다. 작업을 고립된 하위 문제들로 분해하고 각 단계에서 관련된 맥락만을 LLM에 제공함으로써, 미세조정 없이도 체인 오브 썬스팅 편향보다 6.4% 향상된 증거 기반 질문-답변 성능을 달성한다.
In recent years, large pre-trained language models (LLMs) have demonstrated the ability to follow instructions and perform novel tasks from a few examples. The possibility to parameterise an LLM through such in-context examples widens their capability at a much lower cost than finetuning. We extend this line of reasoning and present a method which further expands the capabilities of an LLM by embedding it within an algorithm or program. To demonstrate the benefits of this approach, we present an illustrative example of evidence-supported question-answering. We obtain a 6.4\% improvement over the chain of thought baseline through a more algorithmic approach without any finetuning. Furthermore, we highlight recent work from this perspective and discuss the advantages and disadvantages in comparison to the standard approaches.
연구 동기 및 목표
- 정렬이나 검색과 같은 알고리즘 작업을 수행하는 데 있어, 미세조정 후에도 LLM의 한계를 해결하기 위해.
- 유한한 컨텍스트 길이와 분포 외 일반화 능력이 떨어지는 등의 디코더 전용 트랜스포머의 아키텍처적 제약을 극복하기 위해.
- LLM을 명시적 프로그램 내에 통합함으로써, 미세조정의 대안으로서 확장 가능하고 해석 가능하며 모듈러한 방법을 제공하기 위해.
- 모델 재훈련이 필요 없이도 복잡한 추론 작업 성능을 향상시킬 수 있는 구조적 프로그래머티컬 제어의 가능성을 입증하기 위해.
- LLM 기반 시스템에서 신뢰성, 해석 가능성, 일반화 능력을 향상시키는 데 있어 모듈러한 분해의 이점을 부각하기 위해.
제안 방법
- 복잡한 작업을 더 작은 고립된 하위 문제들로 분해하고, 각 문제는 최소한의 관련 맥락만을 포함한 단일 LLM 호출로 해결한다.
- 상태를 관리하고 LLM 호출을 조율하기 위해 프로그래머틱 제어 플로우를 사용하여, 각 단계가 필요한 입력만을 받도록 보장한다.
- 추론 도중 단락 선택에 대해 트리 탐색을 적용하여, 각 추론 단계에 가장 관련성이 높은 증거를 동적으로 선택한다.
- 단일 통합 프ompt에 의존하는 대신, 잘 정의된 작업 시퀀스를 안내하는 고수준의 알고리즘적 구조를 유지한다.
- LLM을 더 큰 프로그램 내의 서브루틴으로 통합함으로써, 개별 구성 요소의 모듈성, 테스트 가능성, 조합 가능성을 확보한다.
- 정확성과 일관성을 보장하기 위해, LLM의 생성 기능을 구조화된 프레임워크 내에서 활용한다.

실험 결과
연구 질문
- RQ1표준 인라인 컨텍스트 학습 대비, 명시적 프로그램 내에 LLM을 통합하는 것이 알고리즘 및 추론 작업 성능 향상에 기여하는가?
- RQ2고립된 하위 문제 해결 방식을 적용한 프로그래머틱 접근 방식은 단일 프ompt 체인 오브 썬스팅 방법 대비 더 나은 일반화 및 간섭 감소를 이끌어내는가?
- RQ3특히 증거 기반 질문-답변에서, 어떤 정도의 성능 향상이 미세조정 없이도 LLM Programs를 통해 달성 가능한가?
- RQ4LLM Programs의 모듈러하고 알고리즘적인 구조는 종단 간 신경망 모델 대비 해석 가능성과 신뢰성 향상에 어떻게 기여하는가?
- RQ5전문가 예시에 대한 미세조정과 비교했을 때, LLM을 사용한 프로그래밍이 어떤 상황에서 더 유리한가?
주요 결과
- LLM Programs 접근 방식은 미세조정 없이도 체인 오브 썬스팅 기준선 대비 증거 기반 질문-답변 정확도에서 6.4%p의 절대적 향상을 달성했다.
- 하위 문제를 고립시키고 각 LLM 호출에 집중된 맥락을 제공함으로써, 추론 단계 간의 간섭을 감소시켜 전체 추론 품질을 향상시켰다.
- 프로그래머틱 접근 방식은 간단한 일반화 보장을 가능하게 하며, 예를 들어 필터링 및 검색 구성 요소가 더 큰 문서 세트에 자연스럽게 스케일링된다.
- LLM을 알고리즘 내에 통합함으로써, 정보의 동적 로딩 및 요약을 통해 제한된 컨텍스트 길이 등의 아키텍처적 제약을 완화할 수 있다.
- 외부 제어 메커니즘(예: 필터링 또는 검증)을 LLM 호출 간에 구현할 수 있어 더 안전하고 신뢰할 수 있는 동작이 가능해진다.
- 이 방법은 기존 LLM 기능과 호환되며, 재훈련 없이도 추론, 요약, 텍스트 생성 등 다양한 작업에 적용 가능하다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.