[논문 리뷰] Improving Language Model Prompting in Support of Semi-autonomous Task Learning
이 논문은 몸체를 가진 에이전트가 대규모 언어 모델(LLM)의 응답을 고해상도 해석 가능성과 상황적 관련성으로 생성할 수 있도록 하는 템플릿 기반, 반복적 프롬프팅 전략을 제안한다. 상황에 맞는 객체에 기반하여 반복적으로 프롬프트를 정교화함으로써, 이 방법은 행동 가능성과 구문 분석 정확도를 크게 향상시키며, 실시간 환경에서 에이전트가 LLM으로부터 작업에 특화된 지식을 효과적으로 추출하고 적용할 수 있음을 보여준다.
Language models (LLMs) offer potential as a source of knowledge for agents that need to acquire new task competencies within a performance environment. We describe efforts toward a novel agent capability that can construct cues (or "prompts") that result in useful LLM responses for an agent learning a new task. Importantly, responses must not only be "reasonable" (a measure used commonly in research on knowledge extraction from LLMs) but also specific to the agent's task context and in a form that the agent can interpret given its native language capacities. We summarize a series of empirical investigations of prompting strategies and evaluate responses against the goals of targeted and actionable responses for task learning. Our results demonstrate that actionable task knowledge can be obtained from LLMs in support of online agent task learning.
연구 동기 및 목표
- 몸체를 가진 에이전트 시스템에서 대규모 언어 모델(LLM)로부터 작업에 특화된 해석 가능한 지식을 확보하는 데 도전하는 것.
- LLM의 응답이 합리적인 것 외에도, 언어 이해 능력이 제한된 에이전트가 실행 가능하고 해석 가능한지 보장하는 것.
- 에이전트의 현재 환경와 알려진 어휘에 동적으로 적응하는 프롬프팅 전략을 개발하는 것.
- 프롬프트의 구조와 반복적 정교화가 실세계 작업 학습 시나리오에서 응답의 해석 가능성, 관련성, 실행 가능성에 어떤 영향을 미치는지 평가하는 것.
제안 방법
- 템플릿 기반 프롬프팅 프레임워크를 사용하여 LLM으로부터 단계별로 명확한 작업 지시문을 생성하며, 단계 번호 뒤에 동사가 오도록 한다.
- 반복적 프롬프팅 전략을 도입: 각 단계 이후에 모델의 상위-k 다음 토큰 확률을 분석하고, 에이전트는 알려진, 높은 확률의 단어들만 선택하여 프롬프트를 정교화한다.
- 에이전트는 온도=0 및 top_logprobs를 사용하여 GPT-3 API를 활용하여 유사한 다음 토큰을 검색하고 필터링함으로써, 유의미하고 기반된 행동만 선택하도록 보장한다.
- 모델이 ‘(END TASK)’를 출력할 때까지 프로세스를 반복하여, 에이전트가 소비할 수 있는 완전한 작업 계획을 형성한다.
- 관찰 가능한 물체와 에이전트가 이해하는 어휘에 기반한 상황적 기반을 도입하여 프롬프트를 정교화한다.
- 보완적인 목표 표현 프롬프팅 전략을 탐색하며, ‘(RESULT)’와 ‘(END RESULT)’ 구분자들을 사용하여 계획 수립에 활용할 수 있는 고수준의 작업 목표를 유도한다.
실험 결과
연구 질문
- RQ1몸체를 가진 에이전트가 언어 이해 능력이 제한된 상태에서 해석 가능하고 실행 가능한 응답을 생성할 수 있도록 LLM 프롬프팅을 어떻게 구성할 수 있는가?
- RQ2에이전트 주도의 반복적 프롬프트 정교화가 LLM이 생성한 작업 지시의 해석 가능성과 관련성에 어떤 영향을 미치는가?
- RQ3관찰 가능한 환경적 특징과 에이전트 전용 어휘를 포함하는 프롬프팅 전략이 LLM 응답의 상황적 관련성에 기여할 수 있는가?
- RQ4‘(RESULT)’ 구분자를 통해 목표 표현을 포함시키는 것이 LLM이 생성한 작업 계획의 전체 일관성과 유용성에 어떤 영향을 미치는가?
- RQ5템플릿 기반 프롬프팅 전략가지 수많은 작업 도메인에 일반화할 수 있는 정도는 어느 정도이며, 수동 재구성 없이도 적용 가능한가?
주요 결과
- 반복적 프롬프팅 전략은 배치 프롬프팅 대비 응답의 해석 가능성에 크게 기여했으며, 다른 성능 지표는 저하되지 않았다.
- 반복 정교화를 통해 생성된 응답은 알려진 동사 동사를 더 자주 사용했으며, 에이전트가 환경에 쉽게 해석하고 기반할 수 있도록 하였다.
- top_logprobs의 사용은 에이전트가 높은 확률의 알려진 단어들만 필터링하고 선택할 수 있도록 해, 유효하고 실행 가능한 단계를 생성할 가능성을 높였다.
- ‘(RESULT)’와 같은 목표 구분자를 사용한 프롬프팅은 관련성 있고 해석 가능한 고수준 목표(예: ‘목표는 플라스틱 병이 재활용통 안에 있는 것이다’)를 생성했으며, 계획 기반 작업 실행을 지원하였다.
- 템플릿 기반 접근 방식은 다양한 작업 도메인에서 효과적이며, 일반화 가능했으며, 반독립적인 반복적 에이전트 학습에 넓은 적용 가능성을 보였다.
- 초기 결과는 LLM이 생성한 목표와 동작 단계를 결합함으로써 작업 계획의 강건성을 향상시키고, 완벽한 LLM 출력에 대한 의존도를 줄일 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.