Запускаем оценку

Урок 19 из 92 курса «Разработка с Claude API»: официальный курс Anthropic Academy (Антропик) на русском языке. Урок входит в платный доступ; первые уроки курса бесплатно.

Кадр из видеоурока

О чём урок

В процессе разработки с использованием больших языковых моделей (LLM), таких как Claude, крайне важно иметь надежный способ оценки их производительности. Это позволяет нам понимать, насколько хорошо модель справляется с поставленными задачами, выявлять слабые места и итеративно улучшать наши prompts. После того как мы подготовили набор данных для оценки, следующим логичным шагом является создание основного конвейера оценки. Этот конвейер — это автоматизированная система, которая берет каждый тестовый случай из нашего датасета, объединяет его с нашим запросом (prompt), передает Claude для обработки, а затем оценивает полученные результаты. По сути, процесс оценки следует четкому рабочему процессу: мы берем наш набор тестовых случаев, комбинируем каждый из них с нашим шаблоном запроса, отправляем его Claude для обработки, а затем оцениваем вывод с помощью системы оценки, которую мы будем называть градером (grader). В этом уроке мы сосредоточимся на построении скелета этого конвейера, который позволит нам автоматизировать процесс взаимодействия с Claude и сбора данных, оставляя детальную логику оценки для последующих этапов. Конвейер оценки состоит из нескольких основных функций, каждая из которых выполняет свою специфическую задачу. Представьте это как сборочную линию, где каждый этап добавляет что-то к конечному продукту. Давайте рассмотрим эти функции по порядку, начиная с самой простой. Первая и самая фундаментальная функция в нашем конвейере отвечает за формирование запроса к Claude и получение ответа. Мы назовем ее run_prompt. Ее задача — взять отдельный тестовый случай и объединить его с нашим шаблоном запроса, чтобы создать полноценное сообщение для модели. Представьте, что у вас есть тестовый случай, который содержит описание задачи, например: {"task": "Summarize the following text about AI."}. Функция run_prompt возьмет эту задачу и вставит ее в заранее определенный шаблон запроса. На начальном этапе этот шаблон может быть очень простым, например: После формирования полного запроса, функция run_prompt отправляет его Claude (например, через API или SDK) и получает ответ.

План урока

  1. Запуск процесса оценки (Running the Eval)
  2. Построение основных функций конвейера
  3. Функция run_prompt: Подготовка запроса и взаимодействие с Claude
  4. Функция run_test_case: Обработка отдельного тестового случая
  5. Функция run_eval: Координация всего процесса оценки
  6. Выполнение оценки и анализ результатов
  7. Изучение полученных результатов
  8. Что мы достигли и следующие шаги

Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.

Полезные гиды