О чём урок
В этом руководстве показано, как **измерять и улучшать способность модели извлекать структурированную информацию из исходного кода** с помощью оценки инструментария. В данном случае, это набор *символов* (функций, классов, методов и переменных), определённых в файлах Python. Установите последнюю версию пакета Python **openai** (≥ 1.14.0) и установите переменную среды OPENAI_API_KEY. Если вы также хотите оценить *помощника с инструментами*, включите *Assistants v2 beta* в своей учётной записи. Ниже мы импортируем SDK, создаём клиент и определяем вспомогательную функцию, которая создаёт небольшой датасет из файлов внутри самого пакета **openai**. get_dataset создаёт небольшой датасет в оперативной памяти, считывая несколько файлов SDK. structured_output_grader определяет подробную рубрику оценки. sampled.output_tools[0].function.arguments.symbols указывает извлечённые символы из файла кода на основе вызова инструмента. client.evals.create(...) регистрирует eval на платформе. Здесь мы создаём eval, который будет использоваться для оценки качества извлечённой информации из файлов кода. Здесь мы запускаем два прогона для одной и той же оценки (eval): один, который вызывает endpoint **Completions**, и один, который вызывает endpoint **Responses**. Мы создаём утилиту для опроса, которая будет использоваться для получения результатов прогонов eval. Как для completions, так и для responses, мы выводим словарь *symbols*, который вернула модель. Вы можете сравнить его с эталонным ответом или вычислить точность (precision) / полноту (recall).
План урока
- Настройка
- Фабрика датасетов и рубрика оценки
- Создание Evals
- Запуск прогонов модели
- Утилита для опроса
- Изучение результатов
- Символы вывода Completions против Responses
- Визуализация дашборда Evals
Урок входит в полный доступ. Полный текст и видео открываются после оплаты. Первые уроки каждого курса бесплатны.