О чём урок
Этот notebook проведет вас через набор целенаправленных, запускаемых примеров использования фреймворка OpenAI Evals для тестирования, оценки и итерации задач, требующих от больших языковых моделей создания структурированных выводов. Почему это важно?Промышленные системы часто зависят от JSON, SQL или предметно-ориентированных форматов. Полагаться на выборочные проверки или ситуативные корректировки prompt быстро становится неэффективным. Вместо этого вы можете кодифицировать ожидания в виде автоматизированных evals и позволить вашей команде выпускать продукты с кирпичами безопасности вместо песка. Раздел 1 – Предварительные условия: переменные среды и настройка пакетов Раздел 2 – Пошаговое руководство: Извлечение символов кода: сквозная демонстрация, оценивающая способность модели извлекать имена функций и классов из исходного кода. Мы сохраняем исходную логику нетронутой и просто дополняем ее документацией. Раздел 3 – Дополнительные рецепты: наброски распространенных производственных паттернов, таких как извлечение тональности, в качестве дополнительного примера кода для оценки. Раздел 4 – Исследование результатов: легковесные вспомогательные средства для извлечения output выполнения и анализа сбоев. Установите зависимости (показаны минимальные версии): Аутентифицируйтесь, экспортировав ваш ключ: Необязательно: если вы планируете запускать evals в больших объемах, настройте ключ уровня организации с соответствующими лимитами. Цель состоит в том, чтобы извлечь все символы функций, классов и констант из файлов Python внутри OpenAI SDK.Для каждого файла мы просим модель выдать структурированный JSON, например: Затем модель-рубрика оценивает полноту (захватили ли мы каждый символ?) и качество (правильны ли типы?) по шкале от 1 до 7. Рассмотрим пример оценки способности модели извлекать символы из кода с использованием фреймворка OpenAI Evals с пользовательским in-memory dataset. Создает клиент openai.OpenAI, используя OPENAI_API_KEY, который мы экспортировали выше. Без этого ничего не будет работать. get_dataset создает небольшой in-memory dataset, считывая несколько файлов SDK. structured_output_grader определяет подробную рубрику оценки. client.evals.create(...) регистрирует eval на платформе. Здесь мы запускаем два выполнения для одного и того же eval: одно, которое вызывает endpoint Completions, и одно, которое вызывает endpoint Responses.
План урока
- Краткий обзор
- Предварительные условия
- Вариант использования 1: Извлечение символов кода
- Оценка качества извлечения кода с помощью пользовательского Dataset
- Инициализация клиента SDK
- Фабрика Dataset и рубрика оценки
- Запуск выполнения моделей
- Вспомогательный опросчик
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.