Skip to main content
QUICK REVIEW

[논문 리뷰] Hard Prompts Made Easy: Gradient-Based Discrete Optimization for Prompt Tuning and Discovery

Yuxin Wen, Neel Jain|arXiv (Cornell University)|2023. 02. 07.
Gene expression and cancer classification인용 수 40
한 줄 요약

본 논문은 PEZ를 소개합니다. 경사 기반의 방법으로 이산적 하드 프롬프트를 최적화하기 위해 소프트 프롬프트를 연속적으로 업데이트하고 가장 가까운 어휘 임베딩으로 투영하는 방식으로, 모델 간 전이 가능성을 갖춘 이미지 생성과 언어 분류를 위한 효과적인 하드 프롬프트를 가능하게 합니다.

ABSTRACT

The strength of modern generative models lies in their ability to be controlled through text-based prompts. Typical "hard" prompts are made from interpretable words and tokens, and must be hand-crafted by humans. There are also "soft" prompts, which consist of continuous feature vectors. These can be discovered using powerful optimization methods, but they cannot be easily interpreted, re-used across models, or plugged into a text-based interface. We describe an approach to robustly optimize hard text prompts through efficient gradient-based optimization. Our approach automatically generates hard text-based prompts for both text-to-image and text-to-text applications. In the text-to-image setting, the method creates hard prompts for diffusion models, allowing API users to easily generate, discover, and mix and match image concepts without prior knowledge on how to prompt the model. In the text-to-text setting, we show that hard prompts can be automatically discovered that are effective in tuning LMs for classification.

연구 동기 및 목표

  • 수동 작성 없이 하드하고 인간이 읽을 수 있는 프롬프트를 자동으로 학습하게 한다.
  • 포터빌리티와 해석가능성을 위해 소프트 프롬프트 최적화와 이산 하드 프롬프트를 연결한다.
  • 확산 모델을 이용한 이미지 생성과 언어 분류 작업에서 효과를 시연한다.
  • 학습된 프롬프트의 모델 간 전달 가능성과 해석가능성을 위한 유창성 제약의 이점을 보여준다.

제안 방법

  • 연속 프롬프트 임베딩을 유지하고 각 임베딩을 가장 가까운 토큰 임베딩으로 투영하여 이산성을 강제한다.
  • 프롬프트의 브로드캐스트된 배치를 사용한 태스크 특유의 손실에서 계산된 기울기로 연속 프롬프트를 업데이트한다.
  • 이산 최적화 및 양자화 네트워크 계통에서 영감을 받은 기울기 기반 스킴으로 하드 프롬프트를 최적화한다.
  • 확산 모델을 안내하는 자막을 찾기 위해 이미지-텍스트 정렬을 위한 CLIP 기반 손실을 적용한다.
  • 해석가능한 프롬프트를 위한 유창성 페널티와 태스크 손실을 결합하여 이 접근법을 언어 모델에 확장한다.

실험 결과

연구 질문

  • RQ1그래디언트 기반 최적화가 해석 가능하고 모델 간 전이 가능한 이산 하드 프롬프트를 신뢰할 수 있게 학습할 수 있는가?
  • RQ2학습된 하드 프롬프트가 텍스트-이미지 생성 및 텍스트-텍스트 분류에서 기준선과 비교해 어떤 성능을 보이는가?
  • RQ3프롬프트 길이와 유창성 제약이 성능과 전이 가능성에 어떤 영향을 미치는가?
  • RQ4CLIP 가이던스를 통해 이미지에서 발견된 프롬프트를 확산 모델을 효과적으로 조종하는 데 직접 사용할 수 있는가?
  • RQ5하드 프롬프트를 이미지에서 발견하고 연결하거나 축소하여도 효과가 유지되는가?

주요 결과

  • 학습된 하드 프롬프트(PEZ)는 다수의 데이터셋에서 CLIP 기반 유사도 점수 측면에서 경쟁력 있는 결과를 얻고, 일부 기준선보다 훨씬 적은 토큰을 사용한다.
  • 키워드 뱅크나 CLIP 기반 가이던스를 활용한 PEZ는 CLIP 인터로게이터의 성능에 근접하거나 이를 따라가면서도 더 적은 토큰과 무거운 보조 모델 없이도 가능하다.
  • 언어 태스크에서 유창성 제약 여부에 관계없이 PEZ는 GPT-2 계열 및 더 큰 LM들에 대해 정확도 전이가 경쟁력 있거나 우수하며 AGNEWS에서 여러 기준선을 상회한다.
  • 더 긴 프롬프트는 과적합 및 전달성이 떨어질 수 있으며 이미지 생성 태스크의 경우 약 16토큰의 임의 길이가 경험적으로 최적이다.
  • 유창성이 강제될 때 프롬프트의 전달력이 모델 간에 더 잘 향상되며, 연결 또는 증류를 통해 의미의 큰 손실 없이 프롬프트를 구성하거나 축약할 수 있다.
  • 안전성 우려에 대해 논의되며, 특정 API에서 콘텐츠 필터를 우회하거나 금지된 콘텐츠를 재현할 가능성에 대한 이슈가 제기된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.