О чём урок
Оценки ориентированы на задачи и итеративны; это лучший способ проверить работу вашей интеграции LLM и улучшить её. В следующей оценке мы сосредоточимся на задаче тестирования множества вариантов моделей и prompt'ов. Наш сценарий использования: Я хочу добиться максимально возможной производительности от моего суммаризатора push-уведомлений Оценки состоят из двух частей: «Eval» и «Run». «Eval» содержит конфигурацию для ваших критериев тестирования и структуру данных для ваших «Run'ов». Один Eval has_many run'ов, которые оцениваются по вашим критериям тестирования. Мы тестируем следующую интеграцию: суммаризатор push-уведомлений, который принимает несколько push-уведомлений и объединяет их в одно сообщение. Eval содержит конфигурацию, которая используется для нескольких Run'ов, и состоит из двух компонентов: Конфигурация источника данных data_source_config — схема (столбцы), которой соответствуют ваши будущие Run'ы. data_source_config использует JSON Schema для определения того, какие переменные доступны в Eval. Критерии тестирования testing_criteria — как вы будете определять, работает ли ваша интеграция для каждой строки вашего источника данных. Для этого сценария использования мы хотим проверить, насколько хорошо работает суммаризация push-уведомлений, поэтому мы настроим нашу оценку с учетом этого. Этот data_source_config определяет, какие переменные доступны на протяжении всей оценки. Эта схема элемента: Означает, что у нас будет переменная {{item.notifications}} доступна в нашей оценке. "include_sample_schema": TrueОзначает, что у нас будет переменная {{sample.output_text}} доступна в нашей оценке. Теперь мы используем эти переменные для настройки наших критериев тестирования. push_notification_grader — это модель-оценщик (llm-as-a-judge), который анализирует входные данные {{item.notifications}} и сгенерированное резюме {{sample.output_text}} и помечает их как «правильные» или «неправильные».Затем мы указываем с помощью «passing_labels», что считается проходным ответом. Примечание: под капотом это использует структурированные output'ы, чтобы метки всегда были валидными. Теперь мы создадим нашу оценку и начнем добавлять в неё данные!
План урока
- Структура оценок
- Сценарий использования
- Поздравляем, вы только что протестировали 9 различных вариаций prompt'ов и моделей на вашем наборе данных!
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.