Кэширование промптов: продвинутый уровень

Урок 48 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Примечание: Это руководство применимо только к моделям до GPT-5.6. Для GPT-5.6 и более поздних версий см. руководство по кэшированию Prompt'ов. Практическое руководство по кэшированию prompt'ов: основы, влияние на производительность, измерение и стратегии оптимизации. Prompt'ы моделей часто содержат повторяющийся контент — такой как системные инструкции, инструменты и сообщения. Когда запрос содержит префикс, который система недавно обработала, OpenAI может направить его на сервер, который уже вычислил этот префикс, что позволяет модели повторно использовать предыдущую работу вместо пересчета с нуля. Кэширование Prompt'ов может сократить задержку до первого token'а (time-to-first-token latency) до 80% и снизить стоимость входных token'ов до 90%. Оно работает автоматически для всех API запросов и не влечет дополнительных сборов. Цель этого руководства — углубиться в оптимизацию для достижения cache hit'ов. Ознакомьтесь с нашей документацией API и Prompt Caching 101 для получения отличного обзора — давайте углубимся! Cache hit'ы требуют точного, повторяющегося совпадения префикса и работают автоматически для prompt'ов, содержащих 1024 token'а или более, при этом cache hit'ы происходят с шагом в 128 token'ов. Весь префикс запроса может быть кэширован: сообщения, изображения, аудио, определения инструментов и схемы структурированного вывода. In-memory кэширование prompt'ов работает автоматически для всех ваших API запросов. Расширенное кэширование prompt'ов увеличивает этот срок до 24 часов. Кэширование работает только в том случае, если два запроса имеют одинаковый префикс и попадают на одну и ту же машину. Воспользуйтесь необязательным параметром prompt_cache_key для трафика, который использует общие префиксы, чтобы улучшить маршрутизацию. Внимательно рассмотрите влияние кэширования на методы контекстной инженерии, такие как compaction. Отслеживайте кэширование, стоимость и задержку через логи запросов или панель мониторинга Usage во время итераций. Прямой проход через слои transformer'а по входным token'ам является основным фактором, определяющим стоимость и задержку инференса. В стеке transformer'а кэширование prompt'ов применяется конкретно к проекциям ключа и значения внутри слоев внимания.

План урока

  1. 1. Основы кэширования Prompt'ов
  2. 1.1 Основы
  3. 2. Почему кэширование важно
  4. 2.1 Основная техническая причина: Пропуск вычислений Prefill
  5. 2.2 Влияние на стоимость
  6. 2.3 Влияние на задержку
  7. 3. Сначала измерьте кэширование (чтобы можно было итерировать)
  8. 3.1 Для каждого запроса: cached_tokens

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Урок входит в темы

Полезные гиды