Глубокое погружение в концепцию: Обзор оптимизации Prompt'ов
Ранние успехи в обучении на основе prompt'ов показали, что формулировка задач может значительно влиять на производительность языковой модели (LLM). В своей основополагающей работе Браун и соавт. (2020) утверждают, что тщательно разработанные текстовые prompt'ы могут побуждать LLM выполнять новые задачи без обновления каких-либо параметров. В сочетании с эмпирическими данными об эффективности LLM в широком спектре задач, это стимулировало интерес к prompt engineering. Однако ручное проектирование prompt'ов оказалось трудоемким и подверженным ошибкам процессом, требующим экспертных знаний и обширных проб и ошибок (Liu et al., 2023).
Одно из ранних направлений работы было сосредоточено на автоматизированном поиске prompt'ов в непрерывной среде. В частности, Шин и соавт. (2020) представили AutoPrompt — алгоритм поиска с градиентным управлением для нахождения входных триггерных фраз, которые побуждают модели к желаемому поведению.
Позднее Ма и соавт. (2023) предложили дискретный подход к оптимизации prompt'ов, автоматически генерируя их путем извлечения из корпусов и перефразирования существующих prompt'ов.
Эти подходы продемонстрировали, что автоматическое обнаружение prompt'ов осуществимо и эффективно. Также появились методы prompt tuning на основе градиентов, включая такие техники, как prefix-tuning (Li et al., 2021) и prompt tuning (Lester et al., 2021). Оба подхода обучают непрерывные представления (prompt embeddings), добавляемые к входным данным, обновляя лишь небольшое количество параметров и оставляя основную модель неизменной во время инференса.
Бесградиентный подход, не требующий доступа к внутренним механизмам модели — он оперирует только входными токенами, подаваемыми в модель — это RLPrompt (Deng et al., 2022), который формулирует проектирование prompt'ов как задачу обучения с подкреплением (RL).
Эти методы подходят для сценариев, где внутренние механизмы модели недоступны, и привели к созданию неинтуитивных, но эффективных prompt-строк.
Таксономия оптимизации Prompt'ов
Prompting с дополненным извлечением данных
Prompting с дополненным извлечением данных включает внешнюю информацию (например, документы, примеры) в prompt. Сюда относится Retrieval-Augmented Generation (RAG), который добавляет извлеченный контекст к prompt'у (Lewis et al., 2020), и example-based prompting, который выбирает демонстрации из набора данных (Rubin et al., 2021). Хотя эти методы эффективны, они зависят от инфраструктуры извлечения данных, а также от корректно размеченных данных, что затрудняет их применение в случаях, когда любое из этих предположений нарушается.
Непрерывный Prompt Tuning
Методы непрерывного prompt tuning представляют prompt'ы как обучаемые векторы. Очевидно, это предполагает доступ к внутренним механизмам модели, поскольку эти обучаемые векторы затем подаются в слои трансформера для условной генерации. Обучаемые векторы могут быть изменены частично (prefix tuning) или полностью (prompt tuning). Prefix-tuning (Li et al., 2021) и prompt tuning (Lester et al., 2021) выполняют оптимизацию prompt'ов, сначала встраивая кандидатный prompt в вектор, а затем обновляя его, что обеспечивает эффективную адаптацию. Эти методы основаны на градиентах и предполагают доступ к внутренним механизмам модели, что делает их неприменимыми для моделей, доступных только через API.
Дискретная оптимизация "черного ящика"
Методы "черного ящика", такие как ручной поиск, эволюционные стратегии и обучение с подкреплением, работают без доступа к градиентам и, следовательно, одинаково применимы как для моделей с открытыми, так и с закрытыми весами. В частности, RLPrompt (Deng et al., 2022) использует политическую сеть, обученную с помощью обучения с подкреплением (RL), для генерации prompt'ов на основе сигналов вознаграждения. Хотя эти методы эффективны, они часто неэффективны по выборке и вычислительно затратны.
Погружение в самообучающуюся оптимизацию Prompt'ов (SPO)
В своей работе Сян и соавт. (2025) предлагают самообучающуюся оптимизацию Prompt'ов (SPO), которая (i) устраняет необходимость в эталонных данных, используя LLM для оценки собственных результатов, и (ii) объединяет большие и малые модели в самозамыкающемся цикле для повышения эффективности выборки и скорости, оптимизируя prompt'ы, используя всего три примера.
SPO запускает итеративный цикл, в котором модель(и) выступает в роли исполнителя prompt'ов (выполняющего задачу, заданную prompt'ом ( p_k, \phi(p_k) \in \mathcal{T} )), оценщика (сопоставляющего вывод модели со скалярной метрикой производительности ( e: \mathcal{T} \mapsto \mathbb{R} , e(\phi(p_k)) \in \mathbb{R} )) и оптимизатора (оптимизирующего ( p_{k+1} ) с условием ( e(p_{k+1}) \geq e(p_k) )). Путем попарных сравнений между последующими prompt'ами и их уточнением, SPO улучшает prompt'ы ( p_k ) без внешнего контроля. SPO оказалась высокоэффективной и применимой как для открытых, так и для закрытых задач. В отличие от градиентных методов или методов RL, она не требует размеченных данных или доступа к внутренним механизмам модели. Она хорошо подходит для сценариев "черного ящика" и сохраняет интерпретируемость, поскольку работает в пространстве естественного языка. Более того, SPO занимает многообещающее место в ландшафте оптимизации prompt'ов, сочетая сильные стороны методов "черного ящика" и самообучения, минимизируя при этом их ограничения; она указывает на перспективное направление, позволяющее моделям автономно оптимизировать свои собственные prompt'ы с использованием внутренних циклов обратной связи.
Аналитические выводы по оптимизации Prompt'ов
Эффективность выборки Градиентные методы, как правило, более эффективны по выборке, чем оптимизация "черного ящика", хотя недавние работы, такие как SPO (Xiang et al., 2025), демонстрируют эффективную оптимизацию, используя всего несколько выборок за итерацию. Эффективность выборки имеет решающее значение для многих приложений, особенно при работе с более крупными моделями/более медленными настройками инференса.
Зависимость от размеченных данных Непрерывный tuning и RL часто требуют размеченных данных, в то время как такие методы, как SPO, избегают этого, полагаясь на самооценку модели. Таким образом, SPO эффективно позволяет оптимизировать prompt'ы, не полагаясь на ранее собранные данные, и поэтому предпочтительна, когда доступна ограниченная информация для иной оптимизации prompt'ов.
Обобщение и перенос Большинство методов оптимизации prompt'ов на практике, как правило, являются специфичными для конкретной задачи. Некоторые prompt'ы (например, "Давайте подумаем шаг за шагом") обобщаются лучше. Prompt'ы, найденные с помощью RL, иногда переносятся между моделями (Deng et al., 2022).
Устойчивость Производительность prompt'ов может быть хрупкой в отношении формулировки. Непрерывные prompt'ы менее интерпретируемы, а дискретные могут быть чувствительны к небольшим изменениям. Методы, такие как prompt ensembling, помогают смягчить это.
Вычислительная стоимость Ручной prompt engineering вычислительно дешев, но оказывается хрупким и трудоемким. Tuning на основе градиентов оказывается более вычислительно эффективным, в то время как методы RL и поиска дороги из-за количества запросов, необходимых для итерации и улучшения prompt'а. Подходы, подобные SPO, кажутся многообещающими благодаря (i) ограниченному количеству запросов и (ii) неиспользованию внутренних механизмов модели во время тестирования.
Источники
@article{brown2020language,
title={Language models are few-shot learners},
author={Brown, Tom and Mann, Benjamin and Ryder, Nick and Subbiah, Melanie and Kaplan, Jared D and Dhariwal, Prafulla and Neelakantan, Arvind and Shyam, Pranav and Sastry, Girish and Askell, Amanda and others},
journal={Advances in neural information processing systems},
volume={33},
pages={1877--1901},
year={2020}
}
@article{liu2023pre,
title={Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing},
author={Liu, Pengfei and Yuan, Weizhe and Fu, Jinlan and Jiang, Zhengbao and Hayashi, Hiroaki and Neubig, Graham},
journal={ACM computing surveys},
volume={55},
number={9},
pages={1--35},
year={2023},
publisher={ACM New York, NY}
}
@article{ma2023prompt,
title={Is prompt-based finetuning always better than vanilla finetuning? insights from cross-lingual language understanding},
author={Ma, Bolei and Nie, Ercong and Schmid, Helmut and Sch{\"u}tze, Hinrich},
journal={arXiv preprint arXiv:2307.07880},
year={2023}
}
@article{shin2020autoprompt,
title={Autoprompt: Eliciting knowledge from language models with automatically generated prompts},
author={Shin, Taylor and Razeghi, Yasaman and Logan IV, Robert L and Wallace, Eric and Singh, Sameer},
journal={arXiv preprint arXiv:2010.15980},
year={2020}
}
@article{li2021prefix,
title={Prefix-tuning: Optimizing continuous prompts for generation},
author={Li, Xiang Lisa and Liang, Percy},
journal={arXiv preprint arXiv:2101.00190},
year={2021}
}
@article{lester2021power,
title={The power of scale for parameter-efficient prompt tuning},
author={Lester, Brian and Al-Rfou, Rami and Constant, Noah},
journal={arXiv preprint arXiv:2104.08691},
year={2021}
}
@article{deng2022rlprompt,
title={Rlprompt: Optimizing discrete text prompts with reinforcement learning},
author={Deng, Mingkai and Wang, Jianyu and Hsieh, Cheng-Ping and Wang, Yihan and Guo, Han and Shu, Tianmin and Song, Meng and Xing, Eric P and Hu, Zhiting},
journal={arXiv preprint arXiv:2205.12548},
year={2022}
}
@article{rubin2021learning,
title={Learning to retrieve prompts for in-context learning},
author={Rubin, Ohad and Herzig, Jonathan and Berant, Jonathan},
journal={arXiv preprint arXiv:2112.08633},
year={2021}
}
@article{lewis2020retrieval,
title={Retrieval-augmented generation for knowledge-intensive nlp tasks},
author={Lewis, Patrick and Perez, Ethan and Piktus, Aleksandra and Petroni, Fabio and Karpukhin, Vladimir and Goyal, Naman and K{\"u}ttler, Heinrich and Lewis, Mike and Yih, Wen-tau and Rockt{\"a}schel, Tim and others},
journal={Advances in neural information processing systems},
volume={33},
pages={9459--9474},
year={2020}
}
@article{xiang2025self,
title={Self-Supervised Prompt Optimization},
author={Xiang, Jinyu and Zhang, Jiayi and Yu, Zhaoyang and Teng, Fengwei and Tu, Jinhao and Liang, Xinbing and Hong, Sirui and Wu, Chenglin and Luo, Yuyu},
journal={arXiv preprint arXiv:2502.06855},
year={2025}
}