Оценки на практике: мониторинг пересказа уведомлений

Урок 181 из 299 курса «OpenAI Cookbook»: официальный курс OpenAI Academy (ОпенАИ) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

О чём урок

Оценки ориентированы на задачи и итеративны; это лучший способ проверить работу вашей интеграции LLM и улучшить её. В следующей оценке мы сосредоточимся на задаче обнаружения регрессий, вызванных изменениями в наших prompt'ах. Наш сценарий использования: Мы логировали запросы на chat completion, устанавливая store=True в наших производственных запросах на chat completion. Обратите внимание, что вы также можете включить логирование «по умолчанию» в вашей админ-панели (https://platform.openai.com/settings/organization/data-controls/data-retention). Мы хотим проверить, привели ли изменения в наших prompt'ах к регрессиям. Оценки состоят из двух частей: «Eval» и «Run». «Eval» содержит конфигурацию ваших критериев тестирования и структуру данных для ваших «Run'ов». Один Eval может иметь множество Run'ов, каждый из которых оценивается с использованием ваших критериев тестирования. Мы тестируем следующую интеграцию: суммаризацию push-уведомлений, которая принимает несколько push-уведомлений и объединяет их в одно. Это вызов chat completions. Я собираюсь сгенерировать симулированные производственные запросы на chat completion с двумя различными версиями prompt'ов, чтобы проверить их производительность. Первый — это «хороший» prompt, второй — «плохой» prompt. Они будут иметь различные metadata, которые мы используем позже. Вы можете просмотреть созданные вами completions по адресу https://platform.openai.com/logs. Убедитесь, что chat completions отображаются, так как они необходимы для следующего шага. Eval содержит конфигурацию, которая используется совместно несколькими Run'ами, он состоит из двух компонентов: Конфигурация источника данных data_source_config — схема (столбцы), которой соответствуют ваши будущие Run'ы. data_source_config использует JSON Schema для определения того, какие переменные доступны в Eval. Критерии тестирования testing_criteria — как вы будете определять, работает ли ваша интеграция для каждой строки вашего источника данных. Для этого сценария использования мы используем stored-completions, поэтому мы настроим data_source_config. ВажноВероятно, у вас будет много различных сценариев использования stored completions, metadata — лучший способ отслеживать это для оценок, чтобы они оставались сфокусированными и ориентированными на задачи.

План урока

  1. Структура оценок
  2. Сценарий использования
  3. Поздравляем, вы только что обнаружили баг, вы можете откатить его, или внести другое изменение в prompt, и так далее!

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды