[논문 리뷰] In-Context Learning with Iterative Demonstration Selection
이 논문은 제로샷 체인오브thought(Zero-shot-CoT) 추론을 사용하여 반복적으로 다양하면서도 의미적으로 관련성이 높은 예시를 선택하는 반복적 예시 선택(Iterative Demonstration Selection, IDS)을 제안한다. 테스트 샘플에 대한 추론 경로를 생성하고, 반복 과정에서 이러한 경로와 유사한 예시를 선택함으로써, 다양한 NLP 작업에서 기존의 기준보다 일관되게 성능 향상을 이룬다. 유사성 또는 다양성에만 의존하는 방법보다도 성능이 뛰어나다.
Spurred by advancements in scale, large language models (LLMs) have demonstrated strong few-shot learning ability via in-context learning (ICL). However, the performance of ICL has been shown to be highly sensitive to the selection of few-shot demonstrations. Selecting the most suitable examples as context remains an ongoing challenge and an open problem. Existing literature has highlighted the importance of selecting examples that are diverse or semantically similar to the test sample while ignoring the fact that the optimal selection dimension, i.e., diversity or similarity, is task-specific. Based on how the test sample is answered, we propose Iterative Demonstration Selection (IDS) to leverage the merits of both dimensions. Using zero-shot chain-of-thought reasoning (Zero-shot-CoT), IDS iteratively selects examples that are diverse but still strongly correlated with the test sample as ICL demonstrations. Specifically, IDS applies Zero-shot-CoT to the test sample before demonstration selection. The output reasoning path is then used to choose demonstrations that are prepended to the test sample for inference. The generated answer is followed by its corresponding reasoning path for extracting a new set of demonstrations in the next iteration. After several iterations, IDS adopts majority voting to obtain the final result. Through extensive experiments on tasks including reasoning, question answering, and topic classification, we demonstrate that IDS can consistently outperform existing ICL demonstration selection methods.
연구 동기 및 목표
- 인퍼런스 기반 학습(ICL)의 성능에 큰 영향을 미치는 예시 선택에 대한 민감성 문제를 해결하기 위해.
- 최적의 예시 선택 전략이 과제에 따라 다양성 대 유사성으로 달라지며, 이는 한 차원이 항상 다른 것을 능가한다는 가정을 도전하기 위해.
- 제로샷 체인오브thought 추론을 통해 반복적으로 개선하면서 다양성과 유사성을 모두 활용하는 통합된 방법을 제안하기 위해.
- 모델 미세조정이나 모델 파라미터에 대한 접근이 필요 없이, 고정된 대규모 언어 모델(LM)에 적용 가능한 방법으로 ICL 성능을 향상시키기 위해.
- 다양한 NLP 과제와 대규모 언어 모델 아키텍처에서의 강건성과 일관된 성능 향상을 입증하기 위해.
제안 방법
- 테스트 샘플에 제로샷 체인오브thought 프롬프트(예: '한 걸음씩 생각해 봅시다.')를 적용하여 추론 경로를 생성한다.
- 이 추론 경로와 의미적으로 가장 유사한 훈련 예제를 선택하여 초깃값으로 사용하며, 이를 테스트 입력 앞에 삽입하여 추론을 수행한다.
- 모델은 추론 과정에서 새로운 답변과 그에 해당하는 추론 경로를 생성하며, 이를 다음 반복에서 새로운 예시 집합을 선택하는 기초로 사용한다.
- 이러한 반복 과정은 고정된 수의 스텝 동안 반복되며, 각 반복에서 추론 경로의 변화에 따라 예시 집합이 개선된다.
- 여러 반복 후, 모든 반복의 출력 결과를 기반으로 다수결 투표를 통해 최종 예측을 도출한다.
- 추론 경로와 예시 간의 의미적 유사도는 문장 임베딩을 사용한 Sentence-BERT를 활용해 계산하여 선택을 안내한다.

실험 결과
연구 질문
- RQ1다양한 NLP 과제에서 인퍼런스 기반 학습 예시 선택의 주요 기준으로서 다양성 또는 유사성 중 일관되게 뛰어난 성능을 보이는가?
- RQ2예시 선택에서 다양성과 유사성을 동시에 조합하면 현재 최고 수준의 방법을 뛰어넘는 ICL 성능 향상을 이룰 수 있는가?
- RQ3제로샷 체인오브thought 추론을 사용한 반복적 개선이 점차적으로 더 나은 예시 선택과 최종 예측을 이끌 수 있는가?
- RQ4예시 수, 반복 횟수, 기반 대규모 언어 모델 아키텍처의 변화에 대해 제안된 방법이 얼마나 강건한가?
- RQ5모델 파rameter 업데이트나 내부 모델 통계 정보에 접근하지 않더라도, 고정된 대규모 언어 모델에 효과적으로 적용 가능한가?
주요 결과
- IDS는 여섯 개의 다양한 NLP 데이터셋에서 기존의 ICL 예시 선택 방법(예: Top-k-Consistency-CoT 및 Random-Voting-CoT)을 일관되게 능가한다.
- 모든 평가된 데이터셋에서 평균적으로 Top-k-Consistency-CoT 대비 0.9%p의 절대 정확도 향상을 기록했으며, 개별 과제에서는 0.4%에서 1.2%의 개선을 보였다.
- 네 개의 예시를 사용할 경우, IDS는 벤치마크에서 90.9%의 정확도를 기록했고, Top-k-Consistency-CoT는 90.0%를 기록하여 다양한 예시 수에서도 일관된 승리를 보였다.
- 반복 횟수에 관계없이 IDS는 강건한 성능 유지를 보였으며, 세 번의 반복에서 최고 성능를 기록했고, 더 많은 반복 수에서도 일관된 성능 저하가 없어 하이퍼파ram터 선택에 대한 강건성을 시사한다.
- GPT-4에서 평가한 결과, IDS는 93.6%의 정확도를 기록했고, Top-k-Consistency-CoT는 92.8%를 기록하여 다양한 LLM 아키텍처에서도 강건함을 입증했다.
- IDS에서 선택된 예시와 테스트 샘플 간 평균 의미적 유사도는 0.46이었고, Top-k-Consistency-CoT의 0.69보다 낮아, IDS가 의미적으로 더 다양한 예시를 선택하면서도 테스트 입력과 강한 관련성을 유지함을 나타낸다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.