Зачем оценивать промпты

Урок 17 из 100 курса «Claude в Google Vertex AI»: официальный курс Anthropic Academy (Антропик) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

Кадр из видеоурока

О чём урок

При работе с Claude написание хорошего промпта — это только начало. Чтобы создавать надежные AI-приложения, вам необходимо понять две критически важные концепции: prompt engineering и prompt evaluation. Prompt engineering предоставляет вам методы для написания более качественных промптов, в то время как prompt evaluation помогает измерить, насколько хорошо эти промпты на самом деле работают. Prompt engineering — это ваш инструментарий для написания и улучшения промптов. Это набор лучших практик, которые помогают Claude точно понять, что вы запрашиваете и как вы хотите, чтобы он ответил. Думайте об этом как о мастерстве написания промптов — таких как multishot prompting, структурирование с помощью XML tags и многие другие подходы, которые мы рассмотрим. Prompt evaluation, с другой стороны, — это измерение. Это автоматизированное тестирование, которое предоставляет вам объективные метрики того, насколько эффективны ваши промпты на самом деле. Вместо того чтобы гадать, хорошо ли работает ваш промпт, evaluation позволяет вам: Тестировать на соответствие ожидаемым ответам Сравнивать различные версии одного и того же промпта Проверять выходные данные на наличие ошибок После того как вы составили промпт, обычно у вас есть три варианта дальнейших действий: Протестировать промпт один раз и решить, что он достаточно хорош. Это несет значительный риск сбоя в production, когда пользователи предоставляют неожиданные входные данные. Протестировать промпт несколько раз и подкорректировать его для обработки одного или двух corner case. Хотя это лучше, чем вариант 1, пользователи часто будут предоставлять очень неожиданные выходные данные, которые вы не учли. Пропустить промпт через evaluation pipeline для его оценки, затем итерировать промпт на основе объективных данных. Это требует больше работы и затрат на начальном этапе, но дает гораздо больше уверенности в надежности вашего промпта. Варианты 1 и 2 — это ловушки, в которые попадают все инженеры, включая меня. Естественно написать промпт, протестировать его пару раз со своими входными данными и подумать: «этого достаточно».

План урока

  1. Prompt evaluation
  2. Prompt Engineering против Prompt Evaluation
  3. Три пути после написания промпта
  4. Почему большинство инженеров попадают в ловушки тестирования
  5. Ценность систематического evaluation
  6. Практическое задание

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды