[논문 리뷰] Towards Optimizing the Costs of LLM Usage
이 논문은 모델을 호출하지 않고 출력 품질을 추정함으로써 LLM 사용 비용을 줄이는 QC-Opt 프레임워크를 제안한다. 이는 LLM 선택과 입력 토큰 길이를 최적화함으로써 40–90%의 비용 절감과 4–7%의 품질 향상을 달성한다. 품질 인식 기반 LLM 라우팅, 토큰 최적화 히ュ리스틱, 캔디케이트 기반 히ュ리스틱 적용 전략을 통해 달성된다.
Generative AI and LLMs in particular are heavily used nowadays for various document processing tasks such as question answering and summarization. However, different LLMs come with different capabilities for different tasks as well as with different costs, tokenization, and latency. In fact, enterprises are already incurring huge costs of operating or using LLMs for their respective use cases. In this work, we propose optimizing the usage costs of LLMs by estimating their output quality (without actually invoking the LLMs), and then solving an optimization routine for the LLM selection to either keep costs under a budget, or minimize the costs, in a quality and latency aware manner. We propose a model to predict the output quality of LLMs on document processing tasks like summarization, followed by an LP rounding algorithm to optimize the selection of LLMs. We study optimization problems trading off the quality and costs, both theoretically and empirically. We further propose a sentence simplification model for reducing the number of tokens in a controlled manner. Additionally, we propose several deterministic heuristics for reducing tokens in a quality aware manner, and study the related optimization problem of applying the heuristics optimizing the quality and cost trade-off. We perform extensive empirical validation of our methods on not only enterprise datasets but also on open-source datasets, annotated by us, and show that we perform much better compared to closest baselines. Our methods reduce costs by 40%- 90% while improving quality by 4%-7%. We will release the annotated open source datasets to the community for further research and exploration.
연구 동기 및 목표
- 문서 처리 작업(요약, 질문 응답 등)에 있어 LLM 사용의 높고 변동성이 큰 비용 문제를 해결하기 위해.
- 모델을 실제로 호출하지 않고도 LLM 출력 품질을 추정함으로써 비용 효율적인 라우팅 결정을 가능하게 하기 위해.
- 품질과 지연 시간을 유지하거나 향상시키면서 비용을 최소화하기 위해 LLM 선택과 입력 토큰 수를 동시에 최적화하기 위해.
- 품질 저하를 통제하고 토큰 절감을 극대화하는 히ュ리스틱을 사용한 토큰 감소 파이프라인을 개발하기 위해.
- 기업 및 오픈소스 데이터셋에서 프레임워크를 실증적으로 검증하여 비용 절감과 품질 향상을 입증하기 위해.
제안 방법
- 모델을 실행하지 않고 요약 작업에 대한 LLM 출력 품질을 예측하기 위해 고유의 손실 함수를 사용하는 품질 추정 모델을 제안한다.
- 비용, 품질, 지연 시간 제약 조건 하에서 LLM 선택 문제를 해결하기 위해 선형계획법(LP) 반올림 알고리즘을 도입한다.
- 정적 히ュ리스틱 8종(예: 정지어 제거, 약어 단순화 등)을 사용하여 입력 길이를 줄이는 토큰 최적화 모듈을 설계한다.
- 각 문장에 대한 히ュ리스틱 적용의 최적화를 품질 손실을 비용으로, 토큰 절감을 수익으로 간주하여 캔디케이트 문제로 모델링한다.
- 작은 히ュ리스틱 집합에 대해 브루트 포스를 사용하여 문장별 최적의 연산 순서를 결정한다.
- 예측된 품질과 비용 제약 조건에 기반해 가장 적합한 LLM을 선택하고 토큰 최적화를 적용하는 스마트 라우터를 구현한다.
실험 결과
연구 질문
- RQ1모델을 호출하지 않고도 LLM 출력 품질을 정확하게 예측할 수 있는가? 이를 통해 비용 효율적인 라우팅이 가능한가?
- RQ2비용을 최소화하면서 품질을 유지하기 위해 LLM 선택과 입력 토큰 길이를 어떻게 공동 최적화할 수 있는가?
- RQ3히ュ리스틱 기반 압축을 적용할 때 토큰 감소와 품질 저하 사이의 상충 관계는 어떠한가?
- RQ4캔디케이트 기반 공식화가 히ュ리스틱 기반 토큰 감소의 최적 적용을 효과적으로 이끌 수 있는가?
- RQ5다양한 문서 처리 작업에서 제안된 방법이 기준 대비 비용, 품질, 지연 시간 측면에서 어떻게 성능을 발휘하는가?
주요 결과
- 제안된 QC-Opt 프레임워크는 기업 및 오픈소스 데이터셋에서 LLM 사용 비용을 40–90% 절감하면서 출력 품질을 4–7% 향상시켰다.
- 품질 추정 모델은 실제 추론 없이도 LLM 성능을 정확하게 예측할 수 있어 런타임 비용과 지연 시간을 감소시켰다.
- 히ュ리스틱 기반 최적화를 통해 요약 데이터셋에서 최대 22.07%의 압축을 달성했으며, 품질 저하를 통제하였다.
- 캔디케이트 기반 히ュ리스틱 적용 전략은 브루트 포스 기반 히ュ리스틱 적용 대비 품질 저하를 30–50% 감소시켰다.
- Text-Curie와 같은 더 빠르고 저렴한 모델로의 라우팅 덕분에 지연 시간이 약 13% 감소했다.
- 사용자 연구 결과, 인간이 평가한 출력 품질이 BertScore와 같은 자동 메트릭과 일치하여 모델의 예측 정확도를 검증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.